{
  "type": "text",
  "name": "minimax-m2.7-decode",
  "description": "MiniMax-M2.7 decode, 24 queries, qlen=1, ctx=3900, TP=8, EP=16, W8A8, compile",
  "initial_time_s": 0.025116,
  "baseline_time_s": 0.02227,
  "initial_tolerance": 0.1,
  "baseline_tolerance": 0.2,
  "operator_top_n": 10,
  "operator_tolerance": 0.1,
  "user_input": {
    "device": "ATLAS_800_A3_560T_128G_DIE",
    "model_id": "MiniMaxAI/MiniMax-M2.7",
    "num_queries": 24,
    "query_len": 1,
    "context_length": 3900,
    "prefix_cache_hit_rate": 0.0,
    "do_compile": true,
    "allow_graph_break": false,
    "dump_input_shapes": false,
    "chrome_trace": null,
    "graph_log_url": null,
    "log_level": null,
    "quantize_linear_action": "W8A8_STATIC",
    "quantize_lmhead": false,
    "mxfp4_group_size": 32,
    "quantize_attention_action": "DISABLED",
    "enable_sequence_parallel": false,
    "decode": true,
    "num_mtp_tokens": 0,
    "mtp_acceptance_rate": [
      0.9,
      0.6,
      0.4,
      0.2
    ],
    "num_hidden_layers_override": 0,
    "disable_repetition": false,
    "reserved_memory_gb": 0,
    "world_size": 16,
    "tp_size": 8,
    "pp_size": 1,
    "dp_size": null,
    "o_proj_tp_size": null,
    "o_proj_dp_size": null,
    "mlp_tp_size": null,
    "mlp_dp_size": null,
    "lmhead_tp_size": null,
    "lmhead_dp_size": null,
    "ep_size": 16,
    "moe_dp_size": 1,
    "moe_tp_size": null,
    "word_embedding_tp": null,
    "enable_redundant_experts": false,
    "enable_shared_expert_tp": false,
    "enable_dispatch_ffn_combine": false,
    "enable_external_shared_experts": false,
    "host_external_shared_experts": false,
    "block_size": 128,
    "remote_source": "huggingface",
    "image_batch_size": null,
    "image_height": null,
    "image_width": null,
    "performance_model": [
      "analytic"
    ],
    "profiling_database": null
  },
  "operators": [
    {
      "name": "tensor_cast.grouped_matmul_quant_swiglu.default",
      "total_time_s": 0.009318,
      "num_calls": 62
    },
    {
      "name": "tensor_cast.grouped_matmul_quant.default",
      "total_time_s": 0.004883,
      "num_calls": 62
    },
    {
      "name": "tensor_cast.all_to_all.default",
      "total_time_s": 0.002821,
      "num_calls": 124
    },
    {
      "name": "tensor_cast.attention.default",
      "total_time_s": 0.00172,
      "num_calls": 62
    },
    {
      "name": "tensor_cast.static_quant_linear_all_reduce.default",
      "total_time_s": 0.000872635,
      "num_calls": 62
    },
    {
      "name": "tensor_cast.all_gather.default",
      "total_time_s": 0.0007939919999999999,
      "num_calls": 63
    },
    {
      "name": "tensor_cast.quantize.default",
      "total_time_s": 0.0006507859999999999,
      "num_calls": 186
    },
    {
      "name": "aten.mm.default",
      "total_time_s": 0.000554373,
      "num_calls": 63
    },
    {
      "name": "tensor_cast.static_quant_linear.default",
      "total_time_s": 0.000498384,
      "num_calls": 62
    },
    {
      "name": "aten.cat.default",
      "total_time_s": 0.000308774,
      "num_calls": 62
    }
  ]
}