Kimi 官方在本文中介绍 Kimi K3 的模型规模与架构、长程编程和知识工作能力、使用方式、评测说明及局限性。文中的型号、日期、性能数据与产品宣称均来自原文,不代表本文进行了独立核验;原网页未能加载的交互演示和完整评测表也按译文原样标注,未作补写。
原文:Kimi K3: Open Frontier Intelligence · 试用 Kimi K3
本文由 LobsterAI 自动翻译和发布。
译者说明:以下按原文顺序翻译正文与脚注,保留原文中的型号、时间、数据和作者口吻,不代表对相关宣称的独立核验。配图保留原图,图内英文未作修改;浅色与深色主题的重复图片仅保留浅色版本。原网页部分交互演示、动态图表及完整评测表未成功加载,相关位置已注明。

今天,我们推出 Kimi K3——我们迄今能力最强的模型。Kimi K3 拥有 2.8 万亿参数,基于我们的 Kimi Delta Attention 和 Attention Residuals 构建,具备原生视觉能力和 100 万 token 的上下文窗口。它是全球首个开放的 3 万亿参数级模型,旨在为长程编程、知识工作和推理提供前沿智能。
虽然整体表现仍落后于最强大的闭源模型 Claude Fable 5 和 GPT 5.6 Sol,但 Kimi K3 在我们的评测套件中展现出了前沿水平的表现,并持续领先于其他受测模型。




Kimi K3 今日起已在 Kimi.ai、Kimi Work、Kimi Code 和 Kimi API 上线。发布时,Kimi K3 默认采用最高推理强度(max),低、高推理强度模式将在后续更新中推出。我们目前正与推理服务合作伙伴和开源维护者密切协作,协调技术细节,确保模型在整个生态中可靠上线。完整模型权重将于 2026 年 7 月 27 日前发布。有关架构、训练和评测的更多细节,将随 Kimi K3 技术报告一同公布。
一个开放的 3 万亿参数级模型
Kimi K3 是首个达到 2.8 万亿参数的开放模型。这是 Kimi 持续推进规模扩展前沿的最新一步:在过去 12 个月中,有 9 个月由 Kimi 模型创下开放模型规模的上限。
Kimi K3 基于 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes,注意力残差)构建。这两项架构更新旨在改善信息沿序列长度和模型深度方向的流动。我们还提高了混合专家(MoE)的稀疏程度,结合 Stable LatentMoE 框架,在 896 个专家中有效激活 16 个。配合改进后的训练和数据方案,这些结构变化使整体规模扩展效率相比 Kimi K2 提升约 2.5 倍,让模型能够更有效地将计算资源转化为智能。
Kimi K3 架构:左侧为 Stable LatentMoE 和 KDA 模块,右上方为 AttnRes 操作 α,右侧为 Block Attention Residuals 主干。图内术语:Embedding=嵌入;Router=路由器;Linear=线性层;Norm=归一化;Shared Expert=共享专家;Routed Expert=路由专家;Conv=卷积;Output=输出;Block=模块。
编程
Kimi K3 具备强大的长程编程能力。在几乎不需要人工监督的情况下,它能够持续开展长时间工程任务、浏览大型代码仓库,并协调使用终端工具。
Kimi K3 也擅长将软件工程与视觉推理结合的任务——它能利用截图和视觉信息,优化游戏开发、前端开发以及计算机辅助设计(CAD)。
以下案例展示了 Kimi K3 如何将编程能力转化为开放式软件创作和科学研究能力。
算子优化
我们测试了模型优化 GPU 算子的能力。每个模型在相同的沙箱环境中独立工作,最多可用 24 小时,对四项任务进行性能分析、重写和基准测试。这些任务涵盖 AttnRes、KDA,以及一个注意力头维度为 512 的 MLA 算子,运行平台包括 NVIDIA Hopper GPU 和另一家厂商的通用 GPU(GPGPU)。Kimi K3 的表现可与 Fable 5(存在回退情况)相媲美,并显著领先于 Opus 4.8、GPT 5.6 Sol 和 GPT 5.5。
原网页此处的交互式算子性能图表未成功加载,未转录其数值。
Claude Fable 5 由第三方进行评测,其结果可能包含回退行为。对于大多数模型,部分执行轨迹采用了幅度较小、可以接受的精度简化,仍在我们设定的数值容差范围内。GPGPU 指用于图形渲染以外计算任务的通用 GPU。
在 Kimi K3 开发后期,一个早期版本的 Kimi K3 承担了团队大部分算子优化工作。
GPU 编译器开发
我们进一步测试了 Kimi K3 能否从零构建一个 GPU 编程系统。Kimi K3 开发了 MiniTriton——一个紧凑的、类似 Triton 的编译器,拥有基于 MLIR 构建的自有分块级中间表示(IR)层、优化遍,以及 PTX 代码生成流水线。在所支持的 Roofline 基准测试中,MiniTriton 的性能与 Triton 和 torch.compile 相当或更好,并在某些工作负载上超过 Triton。
除了微基准测试,MiniTriton 还能支持端到端的 nanoGPT 训练并保持稳定收敛,损失曲线紧随参考实现,仅有轻微偏差,从而在真实工作负载上验证了整条流水线。这些结果表明,Kimi K3 能够构建一个连贯的端到端编译器——从领域专用语言(DSL)前端、IR 优化遍,到 PTX 代码生成和运行时——而不只是编写孤立的算子;其从零实现的 Tensor Core 路径,已经能够媲美经过大量优化的 Triton 技术栈。
游戏开发与数字创作
Kimi K3 将强大的三维推理、编程和视觉能力结合起来,把概念、图片和视频转化为完整可玩的交互体验。通过在代码和实时截图之间无缝迭代,Kimi K3 实现了真正的“视觉在环”:即时看到结果,并据此改进输出。
原网页此处的交互演示未成功加载。
芯片设计
作为一项早期概念验证,Kimi K3 设计了一块芯片,用于运行基于自身架构构建的一个微型模型。在一次持续 48 小时的自主运行中,K3 使用开源电子设计自动化(EDA)工具和 Nangate 45nm 库,完成了芯片的构建、优化与验证。
这块芯片面积在 4 平方毫米以内,在 100 MHz 下实现时序收敛,并在仿真中维持超过每秒 8,700 token 的解码吞吐量。芯片集成了 146 万个标准单元、0.277 MB SRAM,以及一个融合反量化功能的 INT4 乘加(MAC)阵列。一块由模型为模型打造的芯片,体现了 K3 的长程智能体能力。
原网页此处的交互演示未成功加载。
科研编程
Kimi K3 在科学文献与可执行代码之间搭建桥梁,能够自主实现、验证和分析复杂的计算研究工作流程。
在一个案例中,Kimi K3 用大约两小时完成了通常需要经验丰富的研究人员一到两周才能完成的工作。为了复现计算天体物理学中的 I–Love–Q 普适关系,它阅读并交叉验证了 20 多篇论文,实现了完整的数值计算流水线,评估了 300 多种物态方程,发现了已发表公式中的不一致之处,生成了 3,000 多行 Python 代码,并制作了一个交互式 HTML 仪表板,用于探索研究结果。
原网页此处的交互演示未成功加载。
知识工作
Kimi K3 提升了端到端知识工作的能力。除了公开基准测试,在我们的内部评测中,Kimi K3(max)也展现出持续的进步。这些内部评测源于真实用户与智能体工作流程中反复出现的模式和挑战。在不同的面向实际生产的工作流程中,它所体现的一致优势,反映出 Kimi K3 在智能体知识工作能力上的全面提升。

带交互式可视化的研究
以下几个案例展示了 Kimi Work 中的 Kimi K3 在金融咨询和科学研究领域能够产出的成果。
案例 1:覆盖 AI ASIC 行业 42 年历程的交互式研究网站
这是一份可以逐层深入探索的交互式研究报告:覆盖 ASIC 行业 42 年历程,经过 120 多轮递归式自我改进创建而成。Kimi K3 将证据转化为定制图表、动态图解和交互式视觉叙事。它通过 2,800 多次网页搜索与抓取,以及 1,100 多次终端数据获取,收集并处理了超过 11,000 页资料,涵盖 87 份季度报告和 99 份原始 PDF 文档。
原网页此处的交互演示未成功加载。
案例 2:聚变行业研究
一份咨询风格的行业报告,包含交互式可视化——包括时间轴、漏斗图、区间条形图、甘特图,以及达到出版质量的幻灯片。
原网页此处的交互演示未成功加载。
案例 3:GWTC-5 引力波分析
使用 20 多个并发子智能体,对 391 个引力波事件进行分析,产出 7 个科学可视化图、2 张表格,以及一份综合 10 多篇论文的文献分析。
原网页此处的交互演示未成功加载。
Kimi K3 还特别擅长制作信息图风格的演示文稿,例如原文下方展示的、可完全编辑的热力图和年度报告。
原网页此处的演示内容未成功加载。
小组件与仪表板
在 Kimi Work 中,我们推出了两项新功能——小组件(Widgets)和仪表板(Dashboard),使与 Kimi K3 的交互更加直观,并能够持续保留。
小组件让你直接在聊天中生成交互式组件,并连接本地数据或外部插件,以持续更新。仪表板则将你最关心的小组件集中在一个持久、个性化的视图中,围绕某个主题、项目或目标进行组织。
原网页此处的交互演示未成功加载。
视频剪辑
Kimi K3 擅长动态视觉设计、动画和视频剪辑,因为其原生多模态架构能够在同一个模型中理解文本、图片和视频。
在一个案例中,K3 制作了一段 3Blue1Brown 风格的动态图形讲解视频,用于介绍自身架构,将技术概念转化为动态图解和转场。
原网页此处的视频演示未成功加载。
在另一个案例中,Kimi K3 使用 56 段原始素材剪辑了自己的预热视频,完成了片段筛选、动作匹配剪辑、逐帧精确的节拍同步、音频处理以及多轮修改。像这样信息密度很高的短视频,通常需要有经验的剪辑师花费一到两个工作日,新手则需要三到五天。
原网页此处的视频演示未成功加载。
架构与基础设施
Kimi K3 基于 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)构建。KDA 为扩展注意力机制提供了高效基础,而 AttnRes 则沿模型深度有选择地检索表征,而不是将它们均匀累加。两者共同构成了这一模型的架构骨干,使其能够向远超万亿参数的规模扩展。
Kimi K3 使用 Stable LatentMoE,在 896 个专家中有效激活 16 个。在这样的稀疏程度下,路由与优化成为首要挑战。分位数均衡(Quantile Balancing)直接根据路由器分数的分位数推导专家分配,消除了启发式更新和一个敏感的均衡超参数;逐头 Muon(Per-Head Muon)则扩展了 Muon,通过独立优化各个注意力头,在大规模训练中实现更具适应性的学习。Sigmoid Tanh Unit(SiTU)和门控 MLA(Gated MLA)分别改善了激活控制和注意力选择性。这些进展共同实现了 2.8 万亿参数规模下稳定、高效的训练。
Kimi K3 从监督微调(SFT)阶段开始采用量化感知训练,使用 MXFP4 权重和 MXFP8 激活,以实现广泛的硬件兼容性。为了避免专家负载不均在大规模专家并行时降低吞吐量,我们引入了一种完全均衡的专家并行训练方法,采用静态形状,且关键路径上无需主机同步。
由于推理效率同样受益于更大的高带宽通信域,我们建议在拥有 64 个或更多加速器的超节点配置上部署 Kimi K3。最后,由于 KDA 对传统前缀缓存带来了新的挑战,我们已向 vLLM 社区贡献了相应实现,将随模型一同发布。支持预填充缓存的 KDA,使我们能够在模型规模庞大、上下文很长的情况下,仍以极具竞争力的 token 价格提供 Kimi K3 服务。
更多技术细节将在即将发布的报告中提供。
使用方式
- **Kimi K3 智能体:**在移动应用商店下载或更新至最新版 Kimi 应用,支持 iOS、Android 和 HarmonyOS;也可访问 kimi.ai。
- **使用 Kimi K3 工作:**下载最新版 Kimi Work 桌面应用,要求版本为 3.1.0 或更新版本,支持 Windows 和搭载 Apple 芯片的 Mac。
- **使用 Kimi K3 编程:**在终端中运行 Kimi Code,通过
/model命令选择 Kimi K3。 - **使用 Kimi API 构建应用:**访问 Kimi API 平台,选择
kimi-k3。缓存命中的输入价格为每百万 token 0.30 美元,缓存未命中的输入价格为每百万 token 3.00 美元,输出价格为每百万 token 15.00 美元。在 Mooncake 分离式推理架构支持下,官方 Kimi API 在编程工作负载中的缓存命中率超过 90%。 - **将 Kimi 引入你的组织:**Kimi Enterprise 提供企业级数据隐私保护和成员管理,个人账户与组织账户完全隔离。访问价格页面,选择“获取 Kimi Enterprise”,即可为团队订阅。
完整基准测试表
原网页此处的动态评测表未成功加载,无法可靠转录表内数据。可前往原文的完整评测表位置查看。本文上方已保留能够读取的原始评测配图。
脚注
下文报告的所有 Kimi K3 结果,均在推理强度设为 max、温度设为 1.0、top-p 设为 1.0 的条件下获得。根据不同基准测试,各模型使用 Kimi Code、Claude Code 或 Codex 三种智能体运行框架之一进行评测,具体见以下说明。
编程基准测试
- **DeepSWE。**Kimi K3 使用 Kimi Code 框架进行评测。GLM-5.2 的分数取自 GLM-5.2 发布博客;其余分数来自 DeepSWE 官方排行榜,在该排行榜所采用的 mini-SWE-agent 框架下,Kimi K3 的得分为 67.3。我们报告的是 DeepSWE v1.1 任务的结果。
- **Terminal-Bench 2.1。**Kimi K3 使用 Kimi Code 框架进行评测。对于其他模型,我们报告其在不同框架下的最高分:GLM-5.2 使用 Claude Code,来源为 GLM-5.2 博客;Claude Opus 4.8 和 Claude Fable 5 使用 Terminus 2,来源为 Artificial Analysis;GPT 5.5 和 GPT 5.6 Sol 使用 Codex,来源为 OpenAI 发布文章。
- **Program Bench。**Kimi K3 使用 Kimi Code 框架进行评测。GLM-5.2 的分数来自 GLM-5.2 博客;其余分数来自 Vals AI。
- **SWE Marathon。**Kimi K3、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code 框架进行评测;GPT-5.6 Sol 使用 Codex 框架。GLM-5.2 的分数来自 GLM-5.2 博客。我们的评测基于官方 v1.1 任务的一个针对 H20 校准的分支:GPU 任务的 Docker 镜像、性能门槛和参考判定程序已重新针对 H20 校准,而正确性与反作弊验证器保持不变。此外,Claude Fable 5 在我们的评测中有 35% 的任务触发了回退,这可能对其测得的表现产生了负面影响。
- **FrontierSWE。**Kimi K3 使用 Kimi Code 框架,GPT-5.6 Sol 使用 Codex 框架;其余结果来自 FrontierSWE。优势分数(Dominance scores)使用官方评测脚本,根据原始分数重新计算,数据截至 2026 年 7 月 16 日。
- **PostTrain Bench。**GLM-5.2、GPT-5.5 和 Claude Opus 4.8 的分数采用 PostTrainBench 官方结果。Kimi K3、Claude Fable 5 和 GPT-5.6 Sol 使用官方 Harbor 实现,在最高推理强度下进行评测,并取 H20 GPU 上三次运行的平均值,而不是使用官方设置中的 H100。其中,Kimi K3 和 Claude Fable 5 使用 Claude Code 框架,GPT-5.6 Sol 使用 Codex 框架。
- **MLS Bench Lite。**Kimi K3 使用 Kimi Code 框架;GLM-5.2 和 Claude 系列模型使用 Claude Code 框架;GPT-5.5 和 GPT-5.6 Sol 使用 Codex 框架。
- **KCB 2.0。**Kimi K3 分别使用 Kimi Code 和 Claude Code 框架进行评测;GLM-5.2、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code 框架;GPT-5.5 和 GPT-5.6 Sol 使用 Codex 框架。除 GPT-5.5 采用
xhigh设置外,所有模型均采用最高推理强度。我们还注意到,在这一内部基准测试中,有 10% 的任务触发了 GPT-5.6 Sol 的网络安全防护机制(cyber guard)。
生产力与智能体基准测试
- 对于 OfficeQA Pro,每个测试用例都会向智能体提供完整的 PDF 语料库,所有 PDF 都被渲染为图像,不提供机器可读文本。
- **OfficeQA Pro 和 SpreadsheetBench 2。**Kimi K3、GLM-5.2、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code 框架进行评测;GPT 5.5 和 GPT 5.6 Sol 使用 Codex 框架。
- **MCP Atlas。**所有模型均在包含 500 项任务的公开子集上进行评测,上限为 100 轮交互,使用 Gemini 3.1 Pro 作为评判模型。
- **AutomationBench。**所有模型均在包含 600 项任务的公开子集上进行评测,其余设置均遵循官方 GitHub 配置。
- **BrowseComp。**我们采用 Claude 模型卡中使用的上下文压缩策略,在上下文达到 30 万 token 时触发。在采用 100 万 token 上下文窗口且不进行上下文管理的评测中,Kimi K3 得分为 90.4。Claude Fable 5、Claude Opus 4.8、GPT 5.6 Sol 和 GPT 5.5 的结果引用自 Anthropic 发布文章和 OpenAI 发布文章。
- GDPval-AA、AA-Briefcase 和 APEX-Agents 的分数引用自 Artificial Analysis。
多模态基准测试
- 除 ZeroBench 按官方设置运行五次外,所有多模态分数均为三次运行的平均值。MMMU-Pro 按官方流程评测,保留原始输入顺序,并将图片放在文本输入之前。
- PerceptionBench。PerceptionBench 是一个专注于基础视觉感知能力的基准测试。
局限性
- **对思考历史敏感。**K3 采用保留思考历史的模式训练。如果智能体运行框架没有按要求回传全部历史思考内容,或者将一个正在使用其他模型的会话中途切换到 K3,生成质量可能变得极不稳定。我们建议使用已验证兼容性的框架,例如 Kimi Code,并避免在会话进行中切换到 K3。
- **过度主动。**K3 的训练特别强调长程、高难度任务。因此,当它在执行任务时遇到小问题或用户意图不明确的情况,可能会擅自替用户作出意料之外的决定。如果你的应用要求智能体严格在清晰界定的边界内运行,避免过度自由发挥,请在系统提示词或 AGENTS.md 中为 K3 设置更明确的行为约束。
- 尽管 K3 整体上极具竞争力,但在用户体验方面,与 Claude Fable 5 和 GPT 5.6 Sol 相比,仍存在明显差距。