Kimi K3:智能的新前沿
Kimi K3智能的新前沿原创 Kimi K3 月之暗面 Kimi2026年7月17日 01:02天津犯其至难而图其至远者发之以勇守之以专达之以强。今天我们正式推出 Kimi K3我们迄今能力最强的模型。Kimi K3 是一个2.8 万亿参数模型基于 KDA 混合线性注意力机制Kimi Delta Attention和注意力残差Attention Residuals技术构建原生支持视觉理解并拥有 100 万 token 上下文窗口。它是全球首个开源的 3 万亿级别模型面向长程编程、知识工作和推理等前沿智能场景而设计。虽然 Kimi K3 的整体表现仍落后于最强的闭源模型 Claude Fable 5 和 GPT-5.6 Sol但它在我们的整套评测中展现出前沿水平的能力并稳定超过了其他所有模型。Kimi K3 的发布只是开始我们会继续挖掘 K3 模型的潜力持续提升它在真实任务中的性能表现。即日起可通过 kimi.com、最新版 Kimi 手机App、最新版 Kimi Work 桌面客户端、Kimi Code 和 Kimi API使用Kimi K3 模型。当前默认思考强度为 max极致后续更新后会增加 low 和 high 两种模式。我们目前正与推理合作伙伴和开源维护者密切协作对齐技术细节确保模型能在整个生态中可靠上线。完整模型权重将于 2026 年 7 月 27 日前发布。关于架构、训练和评测的更多细节将随 Kimi K3 技术报告一同公布。3 万亿级开源模型Kimi K3 是首个达到2.8 万亿参数规模的开源模型。这是 Kimi 持续推进模型规模边界的最新一步在过去 12 个月中的 9 个月里Kimi 模型都保持着开源模型的规模上限。Kimi K3 基于Kimi Delta AttentionKDA和 Attention ResidualsAttnRes构建。这两项架构更新都是为了让信息在更长序列和更深模型中流动得更顺畅。我们也进一步扩大了 Mixture of ExpertsMoE的稀疏度结合Stable LatentMoE 框架后模型可以在 896 个专家中高效激活 16 个。再加上训练方法和数据配方的优化这些结构性改进让 Kimi K3 相比 K2 的整体扩展效率提升约 2.5 倍能更有效地把算力转化为能力。编程Kimi K3 具备很强的长程编码能力。在极少人工监督的情况下它可以持续完成长时间工程任务理解和处理大型代码库并协调使用终端工具。Kimi K3 也擅长结合软件工程与视觉推理的任务。它能够利用截图和视觉反馈优化游戏开发、前端和 CAD 等场景。下面的案例展示了 Kimi K3 如何将编码能力转化为开放式软件开发和科学研究能力。■ Kernel 优化我们搭了一个内核优化竞技场想看 Kimi K3 能不能真正把 GPU 内核从头到尾优化好。每个模型都在自己的 GPU 沙箱里独立运行任务、测试框架和生产负载完全一致。最多 24 小时内模型可以分析现有实现、重写内核并反复跑分验证效果。竞技场包含两种硬件平台、三类内核、四个任务在 NVIDIA H200 GPU 上的 Attention Residuals、KDA 线性注意力一个从零实现的 512 头维度 MLA 内核以及一个在某国产GPU上的 KDA 任务。在最大思考强度下Kimi K3 的表现接近 Fable-5含回退机制并明显领先 Opus 4.8、GPT-5.6 Sol 和 GPT 5.5。■ GPU 编译器开发我们进一步测试了Kimi K3 能否从零构建一套 GPU 编程系统。Kimi K3 开发了 MiniTriton一款紧凑的类 Triton 编译器。它基于 MLIR 构建了自己的 tile 级中间表示层并实现了完整的优化 pass 到PTX 代码生成流水线。在其支持的Roofline 基准测试中MiniTriton的性能达到或超越Triton 和 torch.compile并在部分工作负载上优于 Triton。目前它支持 FP32 和 FP64 计算TF32 和 BF16 还在开发中。我们并不期待它早期的Tensor Core 实现能超过已经高度优化的 Triton但结果说明在没有针对 benchmark 走捷径、也没有明显硬编码优化的情况下MiniTriton 已经能生成有竞争力的 GPU 代码。作为端到端验证我们用 TensorLite 训练了 nanoGPT并观察到正常收敛。这说明 Kimi K3 做的不只是生成几个孤立内核而是搭起了一套真正可用的编译器栈包括编程抽象、中间表示、优化 pass、后端代码生成以及接入真实训练负载的能力。■ 创作数字作品Kimi K3 融合强大的 3D 推理、编程与视觉能力可将概念、图像和视频转化为完全可玩的交互体验。Kimi K3 在代码与实时截图之间无缝迭代实现真正的视觉闭环vision in the loop——即时看见输出即刻优化。我们看一些示例▼3D 模拟长征十号火箭发射与回收时长01:14▼3D 开放世界游戏时长00:18▼ 3D GBA模拟器时长00:33▼黑洞卡冈图雅复刻过程时长02:32访问网页https://blackhole-visualizer.ok.kimi.link/■ 芯片设计作为早期概念验证Kimi K3 设计了一款芯片用于运行一个基于自身架构构建的 nano 模型。在连续 48 小时的自主 Agent 运行中K3 基于开源 EDA 工具和 Nangate 45nm 工艺库独立完成了芯片的构建、优化与验证。该芯片面积 4 mm²集成 146 万个标准单元、0.277 MB SRAM 以及带融合反量化的 INT4 MAC 阵列在 100 MHz 下完成时序收敛仿真解码吞吐持续超过每秒 8,700 个 token。一颗由模型设计、为模型服务的芯片正是 K3 长程 Agent 能力的写照。时长00:22(视频由接入 Blender MCP 的 Kimi K3 模型生成)■ 科研编程Kimi K3 可以打通科学文献与可执行代码自主完成复杂计算研究流程的实现、验证和分析。在一个案例中Kimi K3 用约两小时完成了通常需要一名资深研究人员一到两周才能完成的工作。为了复现计算天体物理中的 I-Love-Q 普适关系它阅读并交叉验证了 20 多篇论文实现了完整的数值流程评估了 300 多种状态方程发现了已发表公式中的不一致之处生成了 3,000 多行 Python 代码并产出了一个用于探索结果的交互式 HTML 仪表盘。知识工作Kimi K3 推动了端到端知识工作的进展。除了公开基准外Kimi K3max在我们的内部评测中也展现出稳定提升。这些评测来自真实用户与智能体协作流程中反复出现的任务模式和挑战。Kimi K3 在不同生产场景导向的工作流中都表现出一致优势说明其智能体知识工作能力得到了全面提升。■ 研究及其可视化下面是几个例子展示 Kimi Work 中的 K3 在金融咨询和科研场景中能完成什么。推理芯片行业研究覆盖 ASIC 行业 42 年历史由 K3 经过 120 多轮递归自我改进生成。K3 将证据转化为定制图表、动画示意图和交互式视觉叙事。整个过程中它完成了 2800 多次网页搜索与抓取、1100 多次终端数据拉取处理了 87 份季报和 99 份原始 PDF合计超过 11000 页资料。查看完整交互式报告 推理芯片四十二年 · 这次会不一样吗可控核聚变产业研究这是 K3 制作的一份咨询报告风格的行业研究包含时间线、树状图、瀑布图、甘特图以及达到发布质量的演示文稿。GWTC-5 引力波分析一次对 391 个引力波事件的分析使用 20 多个并发 subagents产出 7 张科学可视化图、2 张表格并综合了 10 多篇论文的文献内容。■ 小组件和看板在 Kimi Work 中我们推出了两个新功能小组件Widgets和看板Dashboard让用户与 Kimi K3 的交互更加可视化也更具持续性。小组件可以在对话中直接生成交互式组件并连接本地数据或外部插件实现持续更新。看板则可以把你最关心的小组件汇总到一个长期保留的个性化视图中并围绕某个主题、项目或目标进行组织。时长01:37■ 视频剪辑Kimi K3 擅长动效设计、动画和视频剪辑因为它原生的多模态架构可以在同一个模型中理解文字、图像和视频。在一个案例中K3 制作了一支介绍自己架构的「3Blue1Brown 」风格动态图形讲解视频把技术概念转化为动画图示和转场时长 4 分半时长04:30另一个案例中Kimi K3 用 56 段原始素材剪出了自己的品牌视频完成了选片、动作匹配剪辑、逐帧卡点、音频处理以及多轮修改。像这样信息密度很高的短视频通常需要有经验的剪辑师花 1 到 2 个工作日完成新手则可能需要 3 到5 天。时长00:20架构和基础设施Kimi K3 基于 Kimi Delta AttentionKDA和 Attention ResidualsAttnRes构建。KDA 为注意力扩展提供了高效基础AttnRes 则不是简单地在各层均匀累积表示而是有选择地跨深度检索表示。二者共同构成了 Kimi K3 的架构骨架使模型能够扩展到万亿参数以上的规模。Kimi K3 采用 Stable LatentMoE在 896 个专家中实际激活 16 个。在这样的稀疏度下路由和优化成为关键挑战。Quantile Balancing 直接根据路由分数的分位数分配专家避免启发式更新和敏感的平衡超参数Per-Head Muon 则将 Muon 扩展到按注意力头独立优化让大规模训练中的学习过程更自适应。Sigmoid Tanh UnitSiTU和 Gated MLA 分别增强激活控制和注意力选择性。这些改进共同支持了 2.8 万亿参数规模下稳定、高效的训练。Kimi K3 从 SFT 阶段开始采用量化感知训练使用 MXFP4 权重和 MXFP8 激活以适配更广泛的硬件。为避免在大规模专家并行中因专家负载不均影响吞吐我们引入了完全均衡的专家并行训练方法使用静态形状并且关键路径上不需要主机同步。由于推理效率同样受益于更大的高带宽通信域我们建议在 64 个或更多加速器组成的 supernode 配置上部署 Kimi K3。最后由于 KDA 给传统 prefix caching 带来了新的挑战我们已向 vLLM 社区贡献了对应实现并将随模型一同发布。借助带 prefill cache 的 KDA即使在大模型规模和长上下文条件下我们也能以很有竞争力的 token 价格提供 Kimi K3 服务。更多技术细节将在后续技术报告中公布。开始使用 Kimi K3使用 Kimi K3 Agents到手机应用商店搜索下载或升级到最新版 Kimi app支持 iOS、Android 和鸿蒙系统或直接访问 kimi.com。与 Kimi K3 一起工作下载最新版 Kimi Work 桌面客户端3.1.0 及以上的版本支持 Windows 和 Apple 芯片的 Mac 电脑。用 Kimi K3 辅助编程Kimi Code 运行在你的电脑终端里通过 /model 命令选择 K3 模型即可开始体验。接入 Kimi API 开发应用访问 Kimi API 开放平台模型选择 kimi-k3价格为每百万 Token 输入2 元命中缓存和 20 元未命中缓存输出100 元。借助 Mooncake 分离式推理架构Kimi 官方 API 编程场景的缓存率超过 90%实际输入价格仅为标准输入价格的 1/4。最高 30% 的充赠活动同步进行中。为员工提供 Kimi 订阅Kimi 企业版支持企业级数据隐私保护、成员管理个人账号与企业账号数据完全隔离。点击这里找到「开通企业版」按钮即可在线为员工订阅 Kimi 会员。此外我们即将面向企业推出托管 Agent 平台Kimi Hosted Agent提供 Agent harness、隔离沙箱和长任务运行环境欢迎加入 Waitlist第一时间参与测试。局限性1. 对历史思考内容敏感 Kimi K3 在后训练过程中全程使用思考历史保留模式如果 agent 框架未按要求回传全部历史思考内容或从其他模型正在进行的会话中切换到 Kimi K3则有可能引发上下文干扰导致内容生成质量不稳定。建议使用 Kimi Code 等经过兼容性验证的 Agent 框架并避免在会话中途切换到 Kimi K3。2. 过于主动Kimi K3 的训练重点优化了长程、高难任务。因此在任务执行过程中遇到小问题或用户意图模糊时它可能会替用户做出非预期的决定。如果你的应用希望 agent 更有边界感、不要过于自由发挥请在 system prompt 或 AGENTS.md 中对 Kimi K3 施加更明确的行为约束。3. 尽管 Kimi K3 总体上是一个非常有竞争力的模型但与 Claude Fable 5 和 GPT-5.6 Sol 相比在用户体验上仍有一定差距。

相关新闻

小蜜陪护机器人 - ESP32-CAM 摄像头配置指南

小蜜陪护机器人 - ESP32-CAM 摄像头配置指南

小蜜陪护机器人 ESP32-CAM 摄像头配置指南 一、小蜜陪护机器人使用 ESP32-CAM 摄像头 小蜜陪护机器人集成了计算机视觉能力,能够实时分析家中画面,提供安防监控、老人看护、宠物观察等功能。为了实现这一能力,小蜜主要采用 ESP32-CAM 作为默…

2026/10/4 15:27:40 阅读更多 →
ClickHouse跳数索引的设计与应用:Bloom Filter与MinMax在查询加速中的效果

ClickHouse跳数索引的设计与应用:Bloom Filter与MinMax在查询加速中的效果

ClickHouse跳数索引的设计与应用:Bloom Filter与MinMax在查询加速中的效果 一、全表扫描40亿行,ClickHouse也扛不住 在一个数据分析场景中,表user_events按小时分区存储了40亿条用户行为事件,查询"找出过去一周所有通过utm_s…

2026/10/4 6:04:48 阅读更多 →
DMA控制器原理与实战:嵌入式系统数据搬运优化指南

DMA控制器原理与实战:嵌入式系统数据搬运优化指南

1. DMA控制器:嵌入式系统的“数据搬运工”在嵌入式系统开发中,尤其是涉及雷达信号处理、高速数据采集或实时图像处理的场景,我们常常会遇到一个核心矛盾:CPU的计算能力是宝贵的,但大量、频繁的数据搬运工作&#xff08…

2026/10/3 0:18:54 阅读更多 →

最新新闻

Bert+CRF三元组识别实战:从序列标注到关系抽取

Bert+CRF三元组识别实战:从序列标注到关系抽取

简介:一套基于Python的中文三元组识别实战工程,面向有一定深度学习基础、正在学习知识图谱构建的开发者,解决从非结构化文本中自动抽取(主体,谓词,客体)结构信息的问题,例如识别“马…

2026/10/5 7:54:53 阅读更多 →
BERT+CRF三元组识别实战:从数据对齐到部署避坑

BERT+CRF三元组识别实战:从数据对齐到部署避坑

简介:这是一份基于 Python 的 NLP 实战项目资源,面向希望掌握知识图谱三元组抽取的中高级开发者。项目使用 Bert 预训练模型结合 CRF 条件随机场完成序列标注,覆盖数据处理、模型构建、训练评估与预测的完整流程,适合学习命名实体…

2026/10/5 7:54:53 阅读更多 →
本地Gradle配置全指南:从版本选型到离线构建排错

本地Gradle配置全指南:从版本选型到离线构建排错

很多人在Android Studio的配置面板里进进出出,却一直没搞清Gradle这个构建工具到底是从哪跑起来的。默认情况下,你新建一个Android项目,IDE会通过项目里的Gradle Wrapper去下载对应的Gradle发行版,缓存到用户目录里;网…

2026/10/5 7:54:53 阅读更多 →
11类动物图像数据集:7000张标注图的工业级用法

11类动物图像数据集:7000张标注图的工业级用法

简介:本资源是一份面向计算机视觉初学者与深度学习实践者的11类动物图像分类数据集,适用于图像分类模型训练、验证与教学演示。数据集已预标注并完成标准划分,包含训练集与测试集,每类图像独立存放,可直接输入CNN、Res…

2026/10/5 7:54:53 阅读更多 →
线性扫描自由度:从2到100定位模型最优复杂度

线性扫描自由度:从2到100定位模型最优复杂度

自由度参数从2线性增长到100,这个实验值得认真做一次。很多团队在模型调参时,自由度靠拍脑袋定,有人说8有人说12,最后谁也说服务不了谁。与其争论,不如把自由度参数从2一路扫到100,让数据告诉你答案。这个实…

2026/10/5 7:54:53 阅读更多 →
插件加载失败?拆解 did not activate 与加载链路排查实战

插件加载失败?拆解 did not activate 与加载链路排查实战

你在终端里看到的failed to load plugins web boot: 2 entries did not activate,大概率不是插件文件损坏,而是插件在加载链路里某个环节没通过校验。我见过太多人卡在这行字上:把配置删了重写,把插件装了又卸,最后发现…

2026/10/5 7:53:52 阅读更多 →

日新闻

马斯克杀回智能体战场,Grok 4.5万亿参数撑腰,Cursor接手数字白领项目:用TaoToken统一Key跑通多模型Agent工作流

马斯克杀回智能体战场,Grok 4.5万亿参数撑腰,Cursor接手数字白领项目:用TaoToken统一Key跑通多模型Agent工作流

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 0:00:22 阅读更多 →
AI编程工具插件机制详解:plugin.json配置与加载失败排查指南

AI编程工具插件机制详解:plugin.json配置与加载失败排查指南

1. 从“plugins”这个词说起:它到底在解决什么问题如果你最近在折腾 AI 编程工具,尤其是 Cursor、Codex CLI、Claude Code 这类带 CLI 的编辑器或命令行助手,那你大概率绕不开一个词——plugins。这个词本身不新鲜,从浏览器到 IDE…

2026/10/5 0:00:23 阅读更多 →
第26课:OpenClaw|日志审计与问题诊断:把日志链路改到 TaoToken 的排查清单

第26课:OpenClaw|日志审计与问题诊断:把日志链路改到 TaoToken 的排查清单

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 0:00:23 阅读更多 →

周新闻

KT148A语音芯片外挂8002D功放的工程实践指南

KT148A语音芯片外挂8002D功放的工程实践指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 5:06:42 阅读更多 →
LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 1:10:22 阅读更多 →
ARM架构深度解析:从RISC设计理念到交叉编译实战

ARM架构深度解析:从RISC设计理念到交叉编译实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 3:06:17 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 11:40:45 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 9:43:54 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 20:14:29 阅读更多 →