Kimi-K3:基于 Kimi Delta Attention 的多模态智能模型项目

Open Frontier Intelligence

分支1Tags0
文件最后提交记录最后更新时间
1 个月前
1 个月前
1 个月前
1 个月前
Kimi K3

Chat Homepage
Hugging Face Twitter Follow Discord ModelScope
License

📰  技术博客 |     📄  完整报告

1. 模型介绍

Kimi K3 是一款开源权重的原生多模态智能体模型,也是我们目前性能最强的模型。它是基于 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)构建的 2800 亿参数模型,具备原生视觉能力和百万token上下文窗口。作为全球首个开源的 3T 级模型,Kimi K3 旨在为长周期编码、知识工作和推理等前沿智能领域提供支持。

核心特性

  • 全新架构:Kimi K3 基于 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)构建,并通过 Stable LatentMoE 框架提升 MoE 稀疏性,可从 896 个专家中激活 16 个——相比 Kimi K2,整体缩放效率约提升 2.5 倍。
  • 长程编码能力:在极少人工干预的情况下,Kimi K3 能够支持长时间工程会话,驾驭大规模代码库,并操控终端工具——从 GPU 内核优化、编译器开发,到视觉闭环游戏开发、CAD 设计,乃至芯片设计。
  • 智能知识工作:Kimi K3 推动端到端知识工作,凭借原生多模态架构,可生成包含交互式可视化、小部件、仪表盘以及动态设计和视频编辑的深度研究成果。
  • 原生多模态与长上下文:Kimi K3 在同一模型内实现文本、图像和视频的理解,并支持 100 万 token 的上下文窗口。
  • 开放前沿权重:我们依据 Kimi K3 许可证发布完整的 Kimi K3 模型权重,让前沿智能技术开放应用于研究、部署及进一步创新。

2. 模型概述

架构 混合专家模型(Mixture-of-Experts, MoE)
总参数数量 2.8T
激活参数数量 104B
层数 93
密集层数 1
注意力层构成 69 个 KDA + 24 个 Gated MLA
注意力隐藏维度 7168
注意力头数 96
潜在 MoE 维度 3584
MoE 隐藏维度(每个专家) 3072
专家数量 896
每 token 选择专家数 16
共享专家数量 2
词汇表大小 160K
上下文长度 1048576
注意力机制 KDA & Gated MLA
激活函数 SiTU-GLU
视觉编码器 MoonViT-V2
视觉编码器参数 401M
量化方式 MXFP4 权重 / MXFP8 激活
(量化感知训练)
模态 文本、图像

3. 评估结果

基准测试 Kimi K3
(max)
Claude Fable 5
(max, w/ fallback)
GPT-5.6 Sol
(max)
Claude Opus 4.8
(max)
GPT-5.5
(xhigh)
GLM-5.2
(max)
推理与知识
GPQA Diamond 93.5 92.6 94.1 91.0 93.5 91.2
CritPt 23.4 28.6 32.3 20.9 27.1 20.9
AA-LCR 74.7 70.0 73.7 67.7 74.3 71.3
HLE-Full 43.5 / 56.0 53.3 / 63.0 44.5 / 58.0 49.8 / 57.9 41.4 / 52.2
编码能力
DeepSWE 67.5 70.0 73.0 59.0 67.0 46.2
ProgramBench 77.8 76.8 77.6 71.9 70.8 63.7
Terminal-Bench 2.1 88.3 88.0 88.8 84.6 83.4 82.7
FrontierSWE 81.2 86.6 71.3 66.7 64.9 67.3
SWE-Marathon 42.0 35.0 39.0 40.0 14.0 13.0
PostTrainBench 36.6 41.4 34.6 34.1 28.4 34.3
MLS-Bench-Lite 48.3 49.9 46.2 42.8 35.5 40.4
SciCode 58.7 60.2 56.1 53.5 56.1 50.5
Kimi Code Bench 2.0 72.9 76.9 64.8 71.7 69.0 64.2
智能体能力
BrowseComp 91.2 88.0 90.4 84.3 84.4
DeepSearchQA (F1) 95.0 94.2 93.1
ResearchRubrics 76.2 73.8 73.5 64.0 71.1
GDPval-AA v2 (Elo) 1686 1747 1736 1593 1491 1510
Toolathlon-Verified 76.5 77.9 74.9 76.2 73.5 59.9
MCPMark-Verified 94.5 87.4 92.9 76.4 92.9
MCP-Atlas 84.2 84.7 83.6 83.6 82.8 82.6
AutomationBench 30.8 29.1 29.7 27.2 22.7 12.9
JobBench 54.3 57.4 45.4 48.4 38.3 43.4
AA-Briefcase (Elo) 1548 1583 1495 1354 1158 1260
Agents' Last Exam 28.3 25.7 29.6 27.0 26.6 20.4
APEX-Agents 41.0 43.3 39.9 39.4 38.5 35.6
OfficeQA Pro 63.3 69.9 63.2 63.9 60.9 41.4
SpreadsheetBench 2 34.8 34.7 32.4 31.6 29.1 28.1
OSWorld-Verified 84.8 85.0 83.0 83.4 79.0
OSWorld 2.0 58.3 66.1 62.6 55.7 49.5
SaaS-Bench 60.1 61.4 56.1 43.8
τ³-Banking 33.4 26.8 33.0 27.6 31.3 26.8
Harvey Lab-AA 94.6 93.6 87.2 91.1 86.3 91.0
CorpFin v2 71.6 71.8 64.4
66.7 68.4 66.1 Finance Agent v2 54.4 56.3 53.8 53.9 51.8 49.7 Legal Research Bench 44.2 49.5 48.1 43.8 40.4 31.3 视觉 WorldVQA ForceAnswer 51.0 56.7 41.8 39.1 38.5 — OmniDocBench 91.1 89.8 85.8 87.9 89.4 — PerceptionBench 58.5 57.2 59.7 47.2 55.8 — Video-MME (w. sub) 90.0 — 89.5 86.0 89.3 — MMVU 82.1 — 81.2 79.2 81.7 — BabyVision w/ python 85.7 90.5 88.9 81.2 83.6 — MMMU-Pro 81.6 / 83.4 81.2 / 86.5 83.0 / 84.6 78.9 / 82.7 81.2 / 83.2 — CharXiv (RQ) 84.8 / 91.3 88.9 / 93.5 84.6 / 89.1 80.5 / 89.9 84.1 / 89.0 — MathVision 94.3 / 97.8 94.8 / 98.6 95.8 / 97.8 86.7 / 97.1 92.2 / 96.8 — ZeroBench (pass@5) 23.0 / 41.0 23.0 / 46.0 17.0 / 35.0 17.0 / 34.0 22.0 / 41.0 —
脚注

所有 Kimi K3 的结果均在推理强度设为“max”且温度值为 1.0 的条件下获得。对于单步任务,如 GPQA Diamond、HLE-Full 以及无需工具的视觉基准测试,我们将 top-p 设置为 0.95;对于智能体任务,top-p 设置为 1.0。对于 HLE-Full、MMMU-Pro、CharXiv (RQ)、MathVision 和 ZeroBench,每个单元格中的分数依次报告未使用工具增强和使用工具增强(HLE-Full 使用通用工具,视觉基准测试使用 Python)的结果。

  1. 推理与知识基准测试
  2. 代码基准测试
    • DeepSWE:Kimi K3 使用 Kimi Code 测试框架进行评估。GLM-5.2 的分数取自 GLM-5.2 发布博客;其余所有分数均来自官方 DeepSWE 排行榜,其中 Kimi K3 使用 mini-SWE-agent 测试框架获得 67.3 分。我们报告的是 DeepSWE v1.1 任务的结果。
    • Terminal-Bench 2.1:Kimi K3 使用 Kimi Code 测试框架进行评估。对于其他所有模型,我们报告不同测试框架下的最佳分数:GLM-5.2 使用 Claude Code(GLM-5.2 发布博客);Claude Opus 4.8 和 Claude Fable 5 使用 Terminus 2(Artificial Analysis);GPT-5.5 和 GPT-5.6 Sol 使用 Codex(OpenAI)。
    • ProgramBench:Kimi K3 使用 Kimi Code 测试框架进行评估。GLM-5.2 的分数来自 GLM-5.2 发布博客;其他所有分数均来自 Vals AI
    • SWE-Marathon:Kimi K3、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code 测试框架进行评估;GPT-5.6 Sol 使用 Codex 测试框架进行评估。GLM-5.2 的分数来自 GLM-5.2 发布博客。我们的评估基于 2026 年 7 月 9 日官方任务(https://www.swe-marathon.org/)的 H20 校准分支,该分支早于最终 v1.1 版本发布:GPU 任务的 Docker 镜像、性能门控和参考验证程序已针对 H20 进行了重新校准,而正确性和反作弊验证器保持不变。此外,在我们的评估中,Claude Fable 5 在 35% 的任务上出现了回退情况,这可能对其测量性能产生了负面影响。
    • FrontierSWE:Kimi K3 使用 Kimi Code 测试框架进行评估,GPT-5.6 Sol 使用 Codex 测试框架进行评估;其他所有结果均来自 FrontierSWE。优势分数是使用官方评估脚本根据原始分数重新计算得出的,截至 2026 年 7 月 16 日为最新数据。
    • PostTrainBench:GLM-5.2、GPT-5.5 和 Claude Opus 4.8 的分数采用官方 PostTrainBench 的结果。Kimi K3、Claude Fable 5 和 GPT-5.6 Sol 使用官方 Harbor 实现进行评估,推理强度设为最大,在 H20 GPU(而非官方设置中的 H100)上进行三次运行取平均值——Kimi K3 和 Claude Fable 5 使用 Claude Code 测试框架,GPT-5.6 Sol 使用 Codex 测试框架。
    • MLS-Bench-Lite:Kimi K3 使用 Kimi Code 测试框架进行评估;GLM-5.2 和 Claude 系列模型使用 Claude Code 测试框架进行评估;GPT-5.5 和 GPT-5.6 Sol 使用 Codex 测试框架进行评估。
    • SciCode:分数引用自 2026 年 7 月 23 日的 Artificial Analysis
    • Kimi Code Bench 2.0(内部):Kimi K3 使用 Kimi Code 测试框架进行评估(使用 Claude Code 测试框架时得分为 73.7);GLM-5.2、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code 测试框架进行评估;GPT-5.5 和 GPT-5.6 Sol 使用 Codex 测试框架进行评估。所有模型均在最大推理强度下进行评估,GPT-5.5 除外,其使用“xhigh”设置。由于该基准测试包含网络安全和安全相关任务,我们还披露拒绝或回退任务的比例:Claude Fable 5 在 80 个任务中出现 13 次回退和 1 次拒绝;GPT-5.6 Sol 的网络防护机制拒绝了 80 个任务中的 10 个;GPT-5.5 在 80 个任务中有 3 次拒绝。
  3. 智能体基准测试
    • OfficeQA Pro:每个测试用例都为智能体提供完整的 PDF 语料库,所有 PDF 均渲染为图像,没有可用的机器可读文本。
    • OfficeQA Pro 和 SpreadsheetBench 2:Kimi K3、GLM-5.2、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code 测试框架进行评估;GPT-5.5 和 GPT-5.6 Sol 使用 Codex 测试框架进行评估。
    • MCP-Atlas:所有模型均在包含 500 个任务的公共子集上进行评估,任务轮次限制为 100,使用 Gemini 3.1 Pro 作为评判器。
    • AutomationBench:所有模型均在包含 600 个任务的公共子集上进行评估,其他方面均遵循官方 GitHub 设置。
    • BrowseComp:我们采用在 300K tokens 时触发的上下文压缩策略。当使用完整的 100 万 token 上下文窗口且不进行上下文管理时,Kimi K3 的得分为 90.4。Claude Fable 5、Claude Opus 4.8、GPT-5.6 Sol 和 GPT-5.5 的结果引用自 AnthropicOpenAI
    • GDPval-AA v2、AA-Briefcase、τ³-Banking、Harvey Lab-AA 和 APEX-Agents:分数引用自 2026 年 7 月 23 日的 Artificial AnalysisAPEX-Agents 排行榜。对于 Harvey Lab-AA,我们报告标准通过率。
    • CorpFin v2、Finance Agent v2 和 Legal Research Bench:分数引用自 Vals AI
    • Agents' Last Exam:分数引用自 2026 年 7 月 23 日的 官方排行榜;我们报告排行榜的主要通过率指标。在排行榜上,每个模型都与特定的测试框架配对:Kimi K3 搭配 Kimi Code;GPT-5.6 Sol 和 GPT-5.5 搭配 Codex;Claude Fable 5、Claude Opus 4.8 和 GLM-5.2 搭配 Claude Code。 Claude Fable 5 条目在 xhigh 强度下运行,其中 40% 的任务被标注为降级。
  4. 多模态基准测试
    • 除 ZeroBench 遵循官方设置运行五次外,所有多模态分数均为三次运行的平均值。MMMU-Pro 的评估遵循官方协议,保留原始输入顺序,并将图像前置到文本输入之前。
    • PerceptionBench 是一个内部基准测试,专注于原子级视觉感知能力。

4. 原生 MXFP4 量化

Kimi K3 从 SFT 阶段开始便应用量化感知训练,采用 MXFP4 权重与 MXFP8 激活值,以实现广泛的硬件兼容性。

5. 部署

Note

您可以通过 https://platform.kimi.ai 访问 Kimi K3 的 API,选择 kimi-k3 即可,我们提供与 OpenAI/Anthropic 兼容的 API。目前,建议在以下推理引擎上运行 Kimi K3:


6. 模型使用

Kimi K3 始终启用思考功能,并会返回 reasoning_content。思考力度通过顶层请求字段 reasoning_effort 进行配置,支持 "low""high""max"(默认值为 "max")。

Kimi K3 是在保留思考历史的模式下训练的。对于多轮对话和工具调用,Kimi K3 要求将 API 返回的完整助手消息原样传递回 messages 中 — 包括 reasoning_contenttool_calls,而不仅仅是 content

import openai

def chat_with_preserved_thinking(client: openai.OpenAI, model_name: str):
    messages = [
        {
            "role": "user",
            "content": "Tell me three random numbers."
        },
        {
            "role": "assistant",
            "reasoning_content": "I'll start by listing five numbers: 473, 921, 235, 215, 222, and I'll tell you the first three.",
            "content": "473, 921, 235"
        },
        {
            "role": "user",
            "content": "What are the other two numbers you have in mind?"
        }
    ]

    response = client.chat.completions.create(
        model=model_name,
        messages=messages,
        stream=False,
        max_tokens=4096,
        reasoning_effort="max",
    )
    # the assistant should mention 215 and 222 that appear in the prior reasoning content
    print(f"response: {response.choices[0].message.reasoning}")
    return response.choices[0].message.content

如需完整指南和示例(视觉输入、结构化输出、部分模式、工具选择、动态工具加载、上下文缓存),请参阅 Kimi K3 快速入门思维量

编码代理框架

Kimi K3 与 Kimi Code CLI 作为其代理框架配合使用时效果最佳。我们诚挚邀请您尝试——在终端中运行 Kimi Code,并使用 /model 命令选择 Kimi K3。希望您能享受使用 Kimi K3 进行构建的过程,也期待听到您的反馈!


7. 许可证

代码仓库和模型权重均根据 Kimi K3 许可证 发布。


8. 联系我们

如有任何问题,请通过 support@moonshot.ai 与我们联系。

项目介绍

开放前沿智能【此简介由AI生成】

定制我的领域
378.68 K710访问 GitHub