{
"type": "text",
"name": "minimax-m2.7-decode",
"description": "MiniMax-M2.7 decode, 24 queries, qlen=1, ctx=3900, TP=8, EP=16, W8A8, compile",
"initial_time_s": 0.025116,
"baseline_time_s": 0.02227,
"initial_tolerance": 0.1,
"baseline_tolerance": 0.2,
"operator_top_n": 10,
"operator_tolerance": 0.1,
"user_input": {
"device": "ATLAS_800_A3_560T_128G_DIE",
"model_id": "MiniMaxAI/MiniMax-M2.7",
"num_queries": 24,
"query_len": 1,
"context_length": 3900,
"prefix_cache_hit_rate": 0.0,
"do_compile": true,
"allow_graph_break": false,
"dump_input_shapes": false,
"chrome_trace": null,
"graph_log_url": null,
"log_level": null,
"quantize_linear_action": "W8A8_STATIC",
"quantize_lmhead": false,
"mxfp4_group_size": 32,
"quantize_attention_action": "DISABLED",
"enable_sequence_parallel": false,
"decode": true,
"num_mtp_tokens": 0,
"mtp_acceptance_rate": [
0.9,
0.6,
0.4,
0.2
],
"num_hidden_layers_override": 0,
"disable_repetition": false,
"reserved_memory_gb": 0,
"world_size": 16,
"tp_size": 8,
"pp_size": 1,
"dp_size": null,
"o_proj_tp_size": null,
"o_proj_dp_size": null,
"mlp_tp_size": null,
"mlp_dp_size": null,
"lmhead_tp_size": null,
"lmhead_dp_size": null,
"ep_size": 16,
"moe_dp_size": 1,
"moe_tp_size": null,
"word_embedding_tp": null,
"enable_redundant_experts": false,
"enable_shared_expert_tp": false,
"enable_dispatch_ffn_combine": false,
"enable_external_shared_experts": false,
"host_external_shared_experts": false,
"block_size": 128,
"remote_source": "huggingface",
"image_batch_size": null,
"image_height": null,
"image_width": null,
"performance_model": [
"analytic"
],
"profiling_database": null
},
"operators": [
{
"name": "tensor_cast.grouped_matmul_quant_swiglu.default",
"total_time_s": 0.009318,
"num_calls": 62
},
{
"name": "tensor_cast.grouped_matmul_quant.default",
"total_time_s": 0.004883,
"num_calls": 62
},
{
"name": "tensor_cast.all_to_all.default",
"total_time_s": 0.002821,
"num_calls": 124
},
{
"name": "tensor_cast.attention.default",
"total_time_s": 0.00172,
"num_calls": 62
},
{
"name": "tensor_cast.static_quant_linear_all_reduce.default",
"total_time_s": 0.000872635,
"num_calls": 62
},
{
"name": "tensor_cast.all_gather.default",
"total_time_s": 0.0007939919999999999,
"num_calls": 63
},
{
"name": "tensor_cast.quantize.default",
"total_time_s": 0.0006507859999999999,
"num_calls": 186
},
{
"name": "aten.mm.default",
"total_time_s": 0.000554373,
"num_calls": 63
},
{
"name": "tensor_cast.static_quant_linear.default",
"total_time_s": 0.000498384,
"num_calls": 62
},
{
"name": "aten.cat.default",
"total_time_s": 0.000308774,
"num_calls": 62
}
]
}