Open Frontier Intelligence
| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
| 1 个月前 | ||
| 1 个月前 | ||
| 1 个月前 | ||
| 1 个月前 |
1. 模型介绍
Kimi K3 是一款开源权重的原生多模态智能体模型,也是我们目前性能最强的模型。它是基于 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)构建的 2800 亿参数模型,具备原生视觉能力和百万token上下文窗口。作为全球首个开源的 3T 级模型,Kimi K3 旨在为长周期编码、知识工作和推理等前沿智能领域提供支持。
核心特性
- 全新架构:Kimi K3 基于 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)构建,并通过 Stable LatentMoE 框架提升 MoE 稀疏性,可从 896 个专家中激活 16 个——相比 Kimi K2,整体缩放效率约提升 2.5 倍。
- 长程编码能力:在极少人工干预的情况下,Kimi K3 能够支持长时间工程会话,驾驭大规模代码库,并操控终端工具——从 GPU 内核优化、编译器开发,到视觉闭环游戏开发、CAD 设计,乃至芯片设计。
- 智能知识工作:Kimi K3 推动端到端知识工作,凭借原生多模态架构,可生成包含交互式可视化、小部件、仪表盘以及动态设计和视频编辑的深度研究成果。
- 原生多模态与长上下文:Kimi K3 在同一模型内实现文本、图像和视频的理解,并支持 100 万 token 的上下文窗口。
- 开放前沿权重:我们依据 Kimi K3 许可证发布完整的 Kimi K3 模型权重,让前沿智能技术开放应用于研究、部署及进一步创新。
2. 模型概述
| 架构 | 混合专家模型(Mixture-of-Experts, MoE) |
| 总参数数量 | 2.8T |
| 激活参数数量 | 104B |
| 层数 | 93 |
| 密集层数 | 1 |
| 注意力层构成 | 69 个 KDA + 24 个 Gated MLA |
| 注意力隐藏维度 | 7168 |
| 注意力头数 | 96 |
| 潜在 MoE 维度 | 3584 |
| MoE 隐藏维度(每个专家) | 3072 |
| 专家数量 | 896 |
| 每 token 选择专家数 | 16 |
| 共享专家数量 | 2 |
| 词汇表大小 | 160K |
| 上下文长度 | 1048576 |
| 注意力机制 | KDA & Gated MLA |
| 激活函数 | SiTU-GLU |
| 视觉编码器 | MoonViT-V2 |
| 视觉编码器参数 | 401M |
| 量化方式 | MXFP4 权重 / MXFP8 激活 (量化感知训练) |
| 模态 | 文本、图像 |
3. 评估结果
| 基准测试 | Kimi K3 (max) |
Claude Fable 5 (max, w/ fallback) |
GPT-5.6 Sol (max) |
Claude Opus 4.8 (max) |
GPT-5.5 (xhigh) |
GLM-5.2 (max) |
|---|---|---|---|---|---|---|
| 推理与知识 | ||||||
| GPQA Diamond | 93.5 | 92.6 | 94.1 | 91.0 | 93.5 | 91.2 |
| CritPt | 23.4 | 28.6 | 32.3 | 20.9 | 27.1 | 20.9 |
| AA-LCR | 74.7 | 70.0 | 73.7 | 67.7 | 74.3 | 71.3 |
| HLE-Full | 43.5 / 56.0 | 53.3 / 63.0 | 44.5 / 58.0 | 49.8 / 57.9 | 41.4 / 52.2 | — |
| 编码能力 | ||||||
| DeepSWE | 67.5 | 70.0 | 73.0 | 59.0 | 67.0 | 46.2 |
| ProgramBench | 77.8 | 76.8 | 77.6 | 71.9 | 70.8 | 63.7 |
| Terminal-Bench 2.1 | 88.3 | 88.0 | 88.8 | 84.6 | 83.4 | 82.7 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 66.7 | 64.9 | 67.3 |
| SWE-Marathon | 42.0 | 35.0 | 39.0 | 40.0 | 14.0 | 13.0 |
| PostTrainBench | 36.6 | 41.4 | 34.6 | 34.1 | 28.4 | 34.3 |
| MLS-Bench-Lite | 48.3 | 49.9 | 46.2 | 42.8 | 35.5 | 40.4 |
| SciCode | 58.7 | 60.2 | 56.1 | 53.5 | 56.1 | 50.5 |
| Kimi Code Bench 2.0 | 72.9 | 76.9 | 64.8 | 71.7 | 69.0 | 64.2 |
| 智能体能力 | ||||||
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 | 84.4 | — |
| DeepSearchQA (F1) | 95.0 | 94.2 | — | 93.1 | — | — |
| ResearchRubrics | 76.2 | — | 73.8 | 73.5 | 64.0 | 71.1 |
| GDPval-AA v2 (Elo) | 1686 | 1747 | 1736 | 1593 | 1491 | 1510 |
| Toolathlon-Verified | 76.5 | 77.9 | 74.9 | 76.2 | 73.5 | 59.9 |
| MCPMark-Verified | 94.5 | 87.4 | 92.9 | 76.4 | 92.9 | — |
| MCP-Atlas | 84.2 | 84.7 | 83.6 | 83.6 | 82.8 | 82.6 |
| AutomationBench | 30.8 | 29.1 | 29.7 | 27.2 | 22.7 | 12.9 |
| JobBench | 54.3 | 57.4 | 45.4 | 48.4 | 38.3 | 43.4 |
| AA-Briefcase (Elo) | 1548 | 1583 | 1495 | 1354 | 1158 | 1260 |
| Agents' Last Exam | 28.3 | 25.7† | 29.6 | 27.0 | 26.6 | 20.4 |
| APEX-Agents | 41.0 | 43.3 | 39.9 | 39.4 | 38.5 | 35.6 |
| OfficeQA Pro | 63.3 | 69.9 | 63.2 | 63.9 | 60.9 | 41.4 |
| SpreadsheetBench 2 | 34.8 | 34.7 | 32.4 | 31.6 | 29.1 | 28.1 |
| OSWorld-Verified | 84.8 | 85.0 | 83.0 | 83.4 | 79.0 | — |
| OSWorld 2.0 | 58.3 | 66.1 | 62.6 | 55.7 | 49.5 | — |
| SaaS-Bench | 60.1 | — | 61.4 | 56.1 | 43.8 | — |
| τ³-Banking | 33.4 | 26.8 | 33.0 | 27.6 | 31.3 | 26.8 |
| Harvey Lab-AA | 94.6 | 93.6 | 87.2 | 91.1 | 86.3 | 91.0 |
| CorpFin v2 | 71.6 | 71.8 | 64.4 | |||
脚注
所有 Kimi K3 的结果均在推理强度设为“max”且温度值为 1.0 的条件下获得。对于单步任务,如 GPQA Diamond、HLE-Full 以及无需工具的视觉基准测试,我们将 top-p 设置为 0.95;对于智能体任务,top-p 设置为 1.0。对于 HLE-Full、MMMU-Pro、CharXiv (RQ)、MathVision 和 ZeroBench,每个单元格中的分数依次报告未使用工具增强和使用工具增强(HLE-Full 使用通用工具,视觉基准测试使用 Python)的结果。
- 推理与知识基准测试
- CritPt 和 AA-LCR:分数引用自 2026 年 7 月 23 日的 Artificial Analysis。
- 代码基准测试
- DeepSWE:Kimi K3 使用 Kimi Code 测试框架进行评估。GLM-5.2 的分数取自 GLM-5.2 发布博客;其余所有分数均来自官方 DeepSWE 排行榜,其中 Kimi K3 使用 mini-SWE-agent 测试框架获得 67.3 分。我们报告的是 DeepSWE v1.1 任务的结果。
- Terminal-Bench 2.1:Kimi K3 使用 Kimi Code 测试框架进行评估。对于其他所有模型,我们报告不同测试框架下的最佳分数:GLM-5.2 使用 Claude Code(GLM-5.2 发布博客);Claude Opus 4.8 和 Claude Fable 5 使用 Terminus 2(Artificial Analysis);GPT-5.5 和 GPT-5.6 Sol 使用 Codex(OpenAI)。
- ProgramBench:Kimi K3 使用 Kimi Code 测试框架进行评估。GLM-5.2 的分数来自 GLM-5.2 发布博客;其他所有分数均来自 Vals AI。
- SWE-Marathon:Kimi K3、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code 测试框架进行评估;GPT-5.6 Sol 使用 Codex 测试框架进行评估。GLM-5.2 的分数来自 GLM-5.2 发布博客。我们的评估基于 2026 年 7 月 9 日官方任务(https://www.swe-marathon.org/)的 H20 校准分支,该分支早于最终 v1.1 版本发布:GPU 任务的 Docker 镜像、性能门控和参考验证程序已针对 H20 进行了重新校准,而正确性和反作弊验证器保持不变。此外,在我们的评估中,Claude Fable 5 在 35% 的任务上出现了回退情况,这可能对其测量性能产生了负面影响。
- FrontierSWE:Kimi K3 使用 Kimi Code 测试框架进行评估,GPT-5.6 Sol 使用 Codex 测试框架进行评估;其他所有结果均来自 FrontierSWE。优势分数是使用官方评估脚本根据原始分数重新计算得出的,截至 2026 年 7 月 16 日为最新数据。
- PostTrainBench:GLM-5.2、GPT-5.5 和 Claude Opus 4.8 的分数采用官方 PostTrainBench 的结果。Kimi K3、Claude Fable 5 和 GPT-5.6 Sol 使用官方 Harbor 实现进行评估,推理强度设为最大,在 H20 GPU(而非官方设置中的 H100)上进行三次运行取平均值——Kimi K3 和 Claude Fable 5 使用 Claude Code 测试框架,GPT-5.6 Sol 使用 Codex 测试框架。
- MLS-Bench-Lite:Kimi K3 使用 Kimi Code 测试框架进行评估;GLM-5.2 和 Claude 系列模型使用 Claude Code 测试框架进行评估;GPT-5.5 和 GPT-5.6 Sol 使用 Codex 测试框架进行评估。
- SciCode:分数引用自 2026 年 7 月 23 日的 Artificial Analysis。
- Kimi Code Bench 2.0(内部):Kimi K3 使用 Kimi Code 测试框架进行评估(使用 Claude Code 测试框架时得分为 73.7);GLM-5.2、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code 测试框架进行评估;GPT-5.5 和 GPT-5.6 Sol 使用 Codex 测试框架进行评估。所有模型均在最大推理强度下进行评估,GPT-5.5 除外,其使用“xhigh”设置。由于该基准测试包含网络安全和安全相关任务,我们还披露拒绝或回退任务的比例:Claude Fable 5 在 80 个任务中出现 13 次回退和 1 次拒绝;GPT-5.6 Sol 的网络防护机制拒绝了 80 个任务中的 10 个;GPT-5.5 在 80 个任务中有 3 次拒绝。
- 智能体基准测试
- OfficeQA Pro:每个测试用例都为智能体提供完整的 PDF 语料库,所有 PDF 均渲染为图像,没有可用的机器可读文本。
- OfficeQA Pro 和 SpreadsheetBench 2:Kimi K3、GLM-5.2、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code 测试框架进行评估;GPT-5.5 和 GPT-5.6 Sol 使用 Codex 测试框架进行评估。
- MCP-Atlas:所有模型均在包含 500 个任务的公共子集上进行评估,任务轮次限制为 100,使用 Gemini 3.1 Pro 作为评判器。
- AutomationBench:所有模型均在包含 600 个任务的公共子集上进行评估,其他方面均遵循官方 GitHub 设置。
- BrowseComp:我们采用在 300K tokens 时触发的上下文压缩策略。当使用完整的 100 万 token 上下文窗口且不进行上下文管理时,Kimi K3 的得分为 90.4。Claude Fable 5、Claude Opus 4.8、GPT-5.6 Sol 和 GPT-5.5 的结果引用自 Anthropic 和 OpenAI。
- GDPval-AA v2、AA-Briefcase、τ³-Banking、Harvey Lab-AA 和 APEX-Agents:分数引用自 2026 年 7 月 23 日的 Artificial Analysis 和 APEX-Agents 排行榜。对于 Harvey Lab-AA,我们报告标准通过率。
- CorpFin v2、Finance Agent v2 和 Legal Research Bench:分数引用自 Vals AI。
- Agents' Last Exam:分数引用自 2026 年 7 月 23 日的 官方排行榜;我们报告排行榜的主要通过率指标。在排行榜上,每个模型都与特定的测试框架配对:Kimi K3 搭配 Kimi Code;GPT-5.6 Sol 和 GPT-5.5 搭配 Codex;Claude Fable 5、Claude Opus 4.8 和 GLM-5.2 搭配 Claude Code。† Claude Fable 5 条目在 xhigh 强度下运行,其中 40% 的任务被标注为降级。
- 多模态基准测试
- 除 ZeroBench 遵循官方设置运行五次外,所有多模态分数均为三次运行的平均值。MMMU-Pro 的评估遵循官方协议,保留原始输入顺序,并将图像前置到文本输入之前。
- PerceptionBench 是一个内部基准测试,专注于原子级视觉感知能力。
4. 原生 MXFP4 量化
Kimi K3 从 SFT 阶段开始便应用量化感知训练,采用 MXFP4 权重与 MXFP8 激活值,以实现广泛的硬件兼容性。
5. 部署
Note
您可以通过 https://platform.kimi.ai 访问 Kimi K3 的 API,选择 kimi-k3 即可,我们提供与 OpenAI/Anthropic 兼容的 API。目前,建议在以下推理引擎上运行 Kimi K3:
6. 模型使用
Kimi K3 始终启用思考功能,并会返回 reasoning_content。思考力度通过顶层请求字段 reasoning_effort 进行配置,支持 "low"、"high" 和 "max"(默认值为 "max")。
Kimi K3 是在保留思考历史的模式下训练的。对于多轮对话和工具调用,Kimi K3 要求将 API 返回的完整助手消息原样传递回 messages 中 — 包括 reasoning_content 和 tool_calls,而不仅仅是 content:
import openai
def chat_with_preserved_thinking(client: openai.OpenAI, model_name: str):
messages = [
{
"role": "user",
"content": "Tell me three random numbers."
},
{
"role": "assistant",
"reasoning_content": "I'll start by listing five numbers: 473, 921, 235, 215, 222, and I'll tell you the first three.",
"content": "473, 921, 235"
},
{
"role": "user",
"content": "What are the other two numbers you have in mind?"
}
]
response = client.chat.completions.create(
model=model_name,
messages=messages,
stream=False,
max_tokens=4096,
reasoning_effort="max",
)
# the assistant should mention 215 and 222 that appear in the prior reasoning content
print(f"response: {response.choices[0].message.reasoning}")
return response.choices[0].message.content
如需完整指南和示例(视觉输入、结构化输出、部分模式、工具选择、动态工具加载、上下文缓存),请参阅 Kimi K3 快速入门 和 思维量。
编码代理框架
Kimi K3 与 Kimi Code CLI 作为其代理框架配合使用时效果最佳。我们诚挚邀请您尝试——在终端中运行 Kimi Code,并使用 /model 命令选择 Kimi K3。希望您能享受使用 Kimi K3 进行构建的过程,也期待听到您的反馈!
7. 许可证
代码仓库和模型权重均根据 Kimi K3 许可证 发布。
8. 联系我们
如有任何问题,请通过 support@moonshot.ai 与我们联系。