Kimi K3 实测:2.8T 参数、100 万上下文,我让它做了网页、PPT 和 3D 游戏
Kimi K3 实测2.8T 参数、100 万上下文我让它做了网页、PPT 和 3D 游戏大家好我是王不二。最近事情实在是太多没有第一时间发布K3的实测请各位粉丝海涵。晚是晚了点但好处是排队的人……并没有变少。反正已经迟到几天了索性把测试做得更扎实些。写在前面为了测它我充了 199先说一件有点肉疼的事。K3 上线后实在太火好几次想白嫖测试K3都很客气的把我拒绝了。于是我一咬牙充了 199 的会员。某种意义上我的钱包比我更先体验了 K3。为了给大家做这期测试也算是下了血本看完觉得有用记得给个三连啦。真金白银换来的第一手上手体验基本可以浓缩成四个字大、慢、强、贵。大是真的大我其实有点不理解Kimi之前大家都说不卷参数不卷参数结果Kimi回回把模型越做越大。上一次也是Kimi率先把模型参数从B级别带到了T级别。这次更狠直接奔着3T去了。照这个膨胀速度以后本地部署党可以彻底死心了甚至很多企业端想要本地部署也可以死心了。也挺好我的显卡释放出来全心全意为我的游戏服务。慢是真的慢这个不单单是我的体验基本用过的都会吐槽。倒不是因为显卡、算力什么的不够导致的回复慢。而是模型想太多一个简单任务也要思考半天还要再校验校验完自己还要再润色。但客观来讲面对复杂问题的时候这种做法还是不错的。所以你能明显感觉到模型在处理复杂任务上很强。强是真的强复杂问题上的思考深度确实换来了质量。这里先不展开了下文有实测。贵也是真的贵API 输出价 $15/百万 token比上一代 K2.6$4/百万 token贵了近 4 倍第三方 Artificial Analysis 跑一轮完整评测烧了 1.3 亿输出 token成本约 2690 美元收获中肯评价“聪明但贵且慢”。连 C 端会员都得分档199 这档才算真正用上完整版——是的就是我充的那档。一、K3 基本情况项目内容发布时间2026 年 7 月 16 日深夜上线17 日官宣WAIC 2026 前夕模型定位旗舰模型面向长程编程、知识工作、推理三类前沿场景参数规模2.8 万亿总参数MoE 架构896 个专家、每 token 激活 16 个上下文长度100 万 token最高输出 1048576 token模态原生多模态输入图/视频/文本输出为文本开源承诺完整权重 2026 年 7 月 27 日前发布技术报告随权重一同公布API 价格缓存命中输入 $0.30 / 未命中 $3.00 / 输出 $15.00每百万 token技术方面完整的技术报告要后续随权重一起发目前能看的只有官方技术博客。KDA 混合线性注意力传统注意力生成每个字都要回头看一遍前面所有的内容——前面有 100 个字看 100 个有 100 万个字看 100 万个。所以很多模型的百万上下文是塞得下、用不起。KDA 这套 Kimi 自研的新机制让回头看的成本不再随长度膨胀不管前面是 1 千字还是 100 万字生成下一个字的成本基本恒定。第三方实测百万 token 下生成速度最高快 6.3 倍具体怎么测的要等 7 月 27 日技术报告确认。极致稀疏 MoE共 896 个专家但每次 token 只激活 16 个极致的稀疏比例。官方称扩展效率比 K2 提升约 2.5 倍相当于同样的算力K3 能学到 K2 两倍半的东西。长程 Agentic Coding官方给了三个案例——从零写出 MiniTriton 编译器、单次自主运行 48 小时设计一颗芯片、官方宣传片自己剪。共同点就一个任务链条长到人都会累它几十小时连续决策不跑偏。官方自曝三大局限这一点Kimi做的还是挺坦诚的。①对思考历史敏感一个任务中最好不要切换模型、②过度主动遇到模糊意图会替你做没让它做的决定、③体验与 Fable 5 / GPT 5.6 Sol 仍有差距。性能跑分接下来看看官方发布的基准对比表K3 和 Claude Fable 5、GPT 5.6 Sol、Opus 4.8 这些第一梯队模型正面刚。Coding 编程六个编程基准K3 拿下两个第一Program Bench77.8和 SWE Marathon42.0。输掉的几项里其实落后的差距也并不大。Terminal Bench 2.1终端命令行操作只差 0.5 分。真正差距明显的是 DeepSWE 和 FrontierSWE都是高难度软件工程任务榜首还是 GPT-5.6 Sol 和 Fable 5。General Agents 通用智能体BrowseComp 深度搜索 91.2 第一、Automation Bench 自动化办公 30.8 第一、SpreadsheetBench 表格处理 34.8 险胜拿下第一。输的主要是两个综合 Elo 评分GDPval-AA 和 AA-Briefcase考的是模拟真实岗位的白领知识工作写报告、做分析、处理文档这类。Visual Agents 视觉智能体两个带工具的视觉推理基准K3 都是第二CharXiv 91.3、Zerobench 41.0榜首都是 Fable 5。但是也算稳稳站在第一梯队。二、实测图形、网页、PPT、3D 游戏先交代测试思路。K3 本身只能输出文本输入支持图像、视频、文本但在线使用时我发现K3有图片生成工具所以我先测了两个图片案例热身再把精力放在 K3 最被看好的代码和生成能力上——网页、PPT、3D 游戏各两个案例。prompt 全部原文照录大家可以直观体会一下。2.1 图形测试案例 1 生成美女直播卖农具的图片。卖的是金锄头标价388。直播元素全齐了左上角直播标 5.8 万观看、环形补光灯、手机支架、背景助农惠农 乡村振兴横幅、左下角弹幕滚动右下角红色价格牌金锄头 ¥388。案例 2生成一张试卷有题目有解答有老师的判分。满分100得分98 因为有错误。保证题目和做对的题都是真实正确的。填空、判断全部正确。最后一道应用题计算正确但漏写单位厘米老师扣 2 分98 分的构成完全合理。美中不足是应该是手写部分的字体看着像打印的太工整了。2.2 网页测试前端代码是 K3 第三方盲投登顶的领域两个案例验证含金量。案例 1 生成一个黑客帝国风格的数字雨动画黑色背景上绿色字符日文片假名数字字母从顶部随机位置下落。在这个上面再加一些正常网页有的内容比如把这个网页改造成一个博客。结果很不错数字雨实时渲染画面流畅不卡顿。内容也是有鼻子有眼比较充实。案例 2生成一个销售数据仪表盘页面包含折线图展示近12个月销售额趋势、饼图展示产品类别占比、柱状图对比各区域业绩。使用 ECharts 或 Chart.js 库数据用模拟数据支持图表联动点击饼图区域折线图只显示该区域趋势KPI 卡片、折线图、饼图、柱状图要素齐全。要说不足的话就是这个页面还是太简单了够用但是没有让我感受到惊艳的感觉当然这个也怪prompt太简单了。2.3 PPT 测试PPT 最能暴露内容策划底细——代码可以搜、版式可以套这几页讲什么全靠模型自己组织。案例 1 生成一个PPT讲讲最近特别火的幻兽啪鲁这个游戏大概5页就好。哈哈哈请原谅我最近玩帕鲁有点上头。像素可爱风PPT结构也很清楚封面“4000 万玩家上头”→ 有多火四张数据卡→ 玩法宝可梦×方舟×打工人模拟器→ 1.0 正式版时间轴 → 后续任天堂官司和玩梗。案例 2帮我做一个专业的有深度的商务场景用的AI讲解PPT10页这个效果完全可以到直接使用的程度我初步看了下格式几乎不用改。下次在讲课就直接用K3生成了。2.4 3D 游戏测试最后的重头戏。官方叙事里有一句话生成可玩 Minecraft 克隆——这话听得我心痒我用两个案例来测测它的效果。案例 1帮我用html 生成一个太阳系模型3D的要求可以放大缩小选中对应的星体还可以仔细查看包括旋转放大什么的这个太赞了效果很好包括各个星球的样式也很完美。地球我认真看了很真实、没毛病其他的星球没仔细比对但应该也不差。案例 2做一个H5的我的世界游戏内容主要是向上攀登。主角有发射蜘蛛丝的能力可以荡蜘蛛丝可以顺着蜘蛛丝拉过去比如一些比较高的地方可以利用蜘蛛丝攀登左键发射右键拉扯。要求场景优美。MC 风浮空岛场景草地方块、树叶、水池、像素云和太阳、一应俱全。机制上也确实实现了使用蜘蛛丝的功能。美中不足是有一些地方设计的不合理并不是每一个平台都能跳上去有一些地方必须使用蛛丝。我认真通关了还挺好玩的

相关新闻

数据总线技术选型实战:从单端/差分原理到CAN、RS-485应用解析

数据总线技术选型实战:从单端/差分原理到CAN、RS-485应用解析

1. 数据总线技术选型:从基础原理到实战抉择在电子系统设计的江湖里,数据总线选型是个绕不开的“硬骨头”。它不像写代码,逻辑对了就能跑;总线选错了,轻则信号不稳、通信时断时续,重则整个系统在复杂电磁环境…

2026/7/23 22:42:29 阅读更多 →
LaCo: Large Language Model Pruning via Layer Collapse 解读

LaCo: Large Language Model Pruning via Layer Collapse 解读

一、论文基本信息 论文题目:LaCo: Large Language Model Pruning via Layer Collapse 作者:Yifei Yang、Zouying Cao、Hai Zhao 发表:Findings of EMNLP 2024 方法名称:LaCo,Layer Collapse 论文代码:…

2026/7/23 22:41:29 阅读更多 →
ESC框架知识点

ESC框架知识点

安装ECS在PackageManager中搜索并安装Entities Graphics烘焙Entitypublic class FallingCubeSpawnerAuthoring : MonoBehaviour{public class Baker : Baker<FallingCubeSpawnerAuthoring>{public override void Bake(FallingCubeSpawnerAuthoring authoring){Entity spa…

2026/7/23 22:41:29 阅读更多 →

最新新闻

Kotlin 协程与结构化并发:Scope、Job 与取消

Kotlin 协程与结构化并发:Scope、Job 与取消

文章目录第 1 章 协程是什么&#xff1a;轻量任务 结构化并发踩坑第 2 章 launch 与 async&#xff1a;事件 vs 结果踩坑第 3 章 Dispatcher&#xff1a;Main / IO / Default踩坑第 4 章 取消与协作第 5 章 SupervisorJob&#xff1a;子失败不拖垮全家第 6 章 异常处理与测试踩…

2026/7/23 22:53:36 阅读更多 →
一封核查申请信件滞留多日,到底该由哪个科室签收受理?

一封核查申请信件滞留多日,到底该由哪个科室签收受理?

6月29日&#xff0c;我寄出一封EMS快件&#xff0c;里面是一套案件相关的举证申请材料&#xff0c;希望院领导对21920号案件相关程序情况予以核查。此前在案件审理阶段&#xff0c;我申请以第三人身份参与诉讼&#xff0c;仅得到口头答复&#xff0c;并未出具书面意见。快递收件…

2026/7/23 22:53:36 阅读更多 →
AI趋势监控平台架构与实战解析

AI趋势监控平台架构与实战解析

1. 项目概述&#xff1a;为什么需要AI趋势监控平台&#xff1f;在信息爆炸的时代&#xff0c;每天产生的数据量已经超出了人类处理能力的极限。以2023年为例&#xff0c;全球每天产生的数据量超过3.28亿TB&#xff0c;其中结构化数据仅占20%。传统的数据分析方法已经无法应对这…

2026/7/23 22:53:36 阅读更多 →
从思维链到草稿链:大模型推理能力进化与实践

从思维链到草稿链:大模型推理能力进化与实践

1. 从Chain of Thought到Chain of Draft&#xff1a;大模型推理能力的进化去年我在调试一个合同条款生成项目时&#xff0c;发现直接让大模型输出最终结果总会出现逻辑断层。直到尝试让模型"把思考过程写出来"&#xff0c;生成质量突然提升了37%。这背后正是Chain of…

2026/7/23 22:53:36 阅读更多 →
Micrometer 系列【1】JVM 可观测门面框架全景概述

Micrometer 系列【1】JVM 可观测门面框架全景概述

文章目录1. 概述1.1 框架简介1.2 三大核心项目1.2.1 Micrometer1.2.2 Micrometer Tracing1.2.3 Micrometer Context Propagation1.3 设计目标2. 核心特性2.1 主流框架原生集成2.2 开箱即用的通用埋点能力2.3 全环境兼容&#xff0c;灵活切换监控后端2.4 标准维度化指标模型2.5 …

2026/7/23 22:53:36 阅读更多 →
60.一文搞懂STM32F407内存布局:Flash、SRAM与程序段的底层逻辑

60.一文搞懂STM32F407内存布局:Flash、SRAM与程序段的底层逻辑

一、基础概念&#xff1a;ROM与RAM的本质区别在单片机领域&#xff0c;我们常说的ROM&#xff08;只读存储器&#xff09;和RAM&#xff08;随机访问存储器&#xff09;&#xff0c;在STM32F407中分别对应Flash和SRAM&#xff1a;Flash&#xff08;ROM&#xff09;&#xff1a;…

2026/7/23 22:52:36 阅读更多 →

日新闻

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

更多请点击&#xff1a; https://intelliparadigm.com 第一章&#xff1a;从单点好评到指数级传播&#xff1a;AI副业主理人必须掌握的4层口碑渗透模型&#xff08;含ROI测算表&#xff09; 当AI副业主理人不再仅满足于单次服务交付&#xff0c;而是主动构建可复用、可裂变、可…

2026/7/23 0:00:25 阅读更多 →
AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

更多请点击&#xff1a; https://codechina.net 第一章&#xff1a;AI写作开头钩子设计&#xff1a;为什么你的AI文案完读率不足18%&#xff1f;——基于2,346篇A/B测试报告的归因分析 在对2,346篇跨行业AI生成文案的A/B测试数据进行聚类分析后&#xff0c;我们发现&#xff1…

2026/7/23 0:01:26 阅读更多 →
Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南&#xff1a;免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/23 0:01:26 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中&#xff0c;我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源&#xff0c;还是配置文件、证书等&#xff0c;都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下&#xff0c;但这…

2026/7/22 8:58:19 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP&#xff08;轻量级目录访问协议&#xff09;作为企业级身份认证的黄金标准&#xff0c;已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时&#xff0c;发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/22 19:43:43 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击&#xff1a; https://intelliparadigm.com 第一章&#xff1a;AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”&#xff0c;而是以可解释、可审计、可迭代的方式&#xff0c;赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/23 17:49:47 阅读更多 →

月新闻