在 M1 Max 上跑 2.8T 参数的 Kimi K3:14.6 秒一个 token,但真的能跑
文章目录01 什么是 Deltafin02 安装三条命令然后等两种模式对比从流式升级到完整模式03 使用方式命令行对话OpenAI 兼容 API 服务器几个重要的注意事项04 实际性能M1 Max 的真实表现05 为什么新款 Mac 应该更快06 工作原理怎么塞进 64GB 的07 技术亮点08 这不是产品这是存在性证明09 致谢与许可01 什么是 DeltafinDeltafin 是一个小型研究项目它做了一件看起来有点疯狂的事在一台 64GB 的 M1 Max 笔记本上跑起了 2.8T 参数的 Kimi K3 模型。目前的中位推理速度是0.0687 token/秒——也就是14.6 秒生成一个 token。换算一下大概每分钟能吐出 4 个 token足够你看着文字一个字一个字地往外蹦顺便泡杯茶。所有已发布的运行数据都来自同一台第一代 M1 Max不是更新的 Max 或 Ultra。项目设计上同一套引擎可以延伸到更新的 Apple Silicon Mac 上内存越大、带宽越高效果越好。02 安装三条命令然后等安装过程本身不复杂。三条命令然后你就可以开始生成了。唯一需要真正做决定的是第三步你要选哪种模式# 1. 环境 (Python 3.12, 以及 Xcode CLT) python3 -m venv venv ./venv/bin/pip install torch numpy safetensors tiktoken ml_dtypes blobfile \ transformers4.56.2 einops tokenizers # 2. 编译融合的 MXFP4 内核 clang -O3 -mcpunative -shared -DNO_MAIN -o tools/libmxfp4gemv.dylib tools/fused_gemv.c # 3. 下载模型看下面两种模式 ./venv/bin/python tools/setup_k3.py --full两种模式对比--full推荐--stream所需磁盘空间约 1.7 TB约 215 GB下载时间5–10 小时可断点续传约 30 分钟推理速度14.6 秒/token3 分钟以上/token推理时网络需求无持续连接为什么差这么多每个 token 需要读取 16 个专家 × 92 层 25.8 GB 的专家数据。从本地磁盘读大约需要 4 秒通过网络读……那就是几分钟的事了。如果运行setup_k3.py时不加任何标志它会自动判断磁盘空间够就选--full不够就回退到流式模式并告诉你需要释放多少空间。从流式升级到完整模式流式模式是体验 Deltafin 的好方法不用提前投入 1.7 TB 磁盘空间。想升级的时候一条命令就行./venv/bin/python tools/fetch_experts_all.py # 可断点续传随时可跑 ./venv/bin/python tools/fetch_experts_all.py --dry-run # 先看看需要多少空间 ./venv/bin/python tools/fetch_experts_all.py --layers 1-40 # 只下部分层也行03 使用方式命令行对话# 问一个问题模型会一直生成到回答完毕./venv/bin/python tools/kimi_run.py--chat--promptWhat are the three largest moons of Saturn?# 原始补全不带聊天模板跑满 16 个 token 后停止./venv/bin/python tools/kimi_run.py--promptThe capital of France is--max-new16Token 会边生成边打印你能实时看到文字出现。按 Ctrl-C 可随时中断并输出已生成的内容。一个诚实的提醒K3 在回答前会进行“思考”大约每分钟生成 4.1 个 token。一次完整的聊天回答可能需要一段时间——观看流式输出本身就是体验的一部分。OpenAI 兼容 API 服务器Deltafin 提供了标准的 OpenAI API 服务聊天界面、openai SDK、编程智能体都可以直接用只需要修改 base URL./venv/bin/python tools/serve_openai.py--port8000fromopenaiimportOpenAI clientOpenAI(base_urlhttp://127.0.0.1:8000/v1,api_keynone)rclient.chat.completions.create(modeldeltafin-kimi-k3,messages[{role:user,content:Hello!}])print(r.choices[0].message.content)# 回答print(r.choices[0].message.reasoning_content)# K3 的思考过程已实现/v1/chat/completions、/v1/completions和/v1/models接口流式传输也正常工作。几个重要的注意事项在把自动化工具指向这个服务器之前有几个现实问题需要先知道时间回答会在准备好时返回。请把客户端的超时时间设为小时级别别设成秒级。流式模式慢得多一个聊天模板提示词至少 60 个 token预填充阶段会触及每层的多个专家。如果缓存只填充了一部分一次聊天请求可能需要数小时。完整安装的话就只是正常的“慢速”推理。仅支持贪婪解码temperature和top_p参数会被接收但忽略。一次只处理一个请求第二个并发请求会收到 429 状态码。04 实际性能M1 Max 的真实表现以下所有数据都来自一台 M1 Max10 核 CPU、32 核 GPU、64 GB 内存、内置 NVMe模型完整安装在本地采用 int8 驻留权重、Metal MoE、精确 fp32 计算、贪婪解码关闭追踪功能。指标首个可用版本当前 M1 Max 基准测试提升预填充 / 首个 token5 token 提示词2,429 秒28.0 秒中位数24.9–37.9 秒约 87 倍稳定解码专家本地化约 20 分钟/token0.0687 token/秒14.6 秒/token约 82 倍解码专家流式传输约 20 分钟/token约 3 分钟/token受网络限制中位数约为每分钟 4.1 个 token。一个典型的 M1 Max 性能画像环节耗时等待驻留主干读取53 GB约 5 秒读取每层选定的 16 个专家25.8 GB约 4.3 秒应用主干传输 反量化约 3 秒注意力机制与归一化93 层约 2 秒MoE 专家矩阵乘法约 1 秒解码阶段现在受限于驻留主干的磁盘带宽。这 53 GB 数据每个 token 都要重新读取在约 7 GB/s 的速率下这就占掉了 14.6 秒中的 7.5 秒。除非有更多 RAM足以容纳主干而不挤占专家读取所需的页缓存或者采用更小的主干否则这个瓶颈无法消除。05 为什么新款 Mac 应该更快M1 Max 只是一个保守的参考点。后续 Mac 机型在多个维度上都更强内存带宽M1 Max 为 400 GB/s。M3/M4 Max 显著更高Ultra 型号大致翻倍。GPU更多核心能更快执行 Metal 内核。SSD专家读取是最大的单一环节后续机型配备更快的 NVMe。内存容量这是最重要的因素。53GB 的主干模型无法放入 64GB 机器每个 token 都要从磁盘重新读取。在 128GB 机器上它可以留在页面缓存中这部分开销基本消失。如果你在 M3、M4、M5 或 Ultra 芯片、128GB 及以上内存的机器上尝试项目非常希望看到你的数据——提交一个 issue附上K3_PROFILE1的输出和芯片型号即可。06 工作原理怎么塞进 64GB 的K3 的权重总计约 1.56 TB远超这台机器的磁盘空间更不用说内存了。但混合专家模型有个特点每个 token 只触及自身的一小部分。常驻主干约 114 GBint8 后约 60 GB注意力层、共享专家、潜在投影、嵌入向量。一次性下载每个 token 从本地 NVMe 逐层读取在 GPU 上计算。82,432 个路由专家约 1.45 TB每个 tokenK3 的路由器为每层选取 16 个专家只读取这些专家。完整安装则全部存本地流式模式下按需从 Hugging Face 获取——每个专家一个 HTTP 范围请求存入不断增长的磁盘缓存。流程图示意 Hugging Face CDN (1.56 TB) → MacBook M1 Max ↓ 常驻主干 (60 GB int8) 专家缓存 (原始分片) ↓ 路由器: 每层选 16 个专家 ↓ 融合 MXFP4 GEMV 内核 ↓ 输出 token07 技术亮点以下每项技术都在真实权重上经过了测量验证I/O 与流式处理合并专家数据获取每个专家六个张量在分片文件中恰好连续一次 17.55 MB 的范围请求搞定比逐个获取快约 6.4 倍。原始字节磁盘缓存直接存分片的原始字节无容器格式无解析开销。并行专家读取16 个专家用线程池并行读取实测从缺页中断的 0.87 GB/s 提升到 6.85 GB/s。双层缓冲加载当前层计算时后台同时读取下一层主干数据。前序 token 预取连续 token 约有 31% 的专家选择会重复后台预先获取。计算融合 MXFP4 反量化与 GEMV一个 NEON 内核一次性完成反量化与乘法取代了原先慢得多的“先反量化再矩阵乘”路径。模板层缓冲区复用69 个 KDA 层共享张量形状24 个 MLA 层共享另一组避免频繁内存分配。int8 驻留主干每 token 驻留 I/O 减半质量无明显变化。自定义 Metal 反量化内核融合 int8→fp32 转换、行缩放和拷贝每层加载从 118 毫秒降至 21 毫秒。解码N-gram 推测草稿通过对已生成文本的后缀匹配获得在双位置批次中验证。被接受的草稿精确复现参考序列回滚操作在常数时间内恢复状态无需克隆约 475 MB 数据。08 这不是产品这是存在性证明需要明确这是一个研究原型不是实用的聊天配置。14.6 秒一个 token 的速度距离交互式体验还很遥远长提示词成本高昂——预填充阶段会触及许多专家。它的价值在于存在性证明一台笔记本理论上可以跑通 2.8T 参数的模型。它也是流式推理技术的一个有趣的测试平台。输出是贪婪且可复现的——相同的提示词每次运行都产生相同的 token。比如“法国的首都是 → 巴黎。埃菲尔铁塔位于巴黎。卢浮宫博物馆也在巴黎……”09 致谢与许可Deltafin 大量借鉴了公开发布的研究成果colibri展示了 744B MoE 模型可在 25GB 内存中运行贡献了路由器预取、专家固定、F_NOCACHE 策略等关键技术。ds4 / DwarfStar最清晰的专家流式传输设计零拷贝专家缓冲区、掩码分发、质量评估方法。月之暗面公开了 K3 的权重和可读的建模代码。flash-linear-attentionKDA 适配层的语义来源。llama.cpp / ggml内核内反量化的先例。Deltafin 自身代码采用 MIT 许可。Kimi K3 的权重和建模代码归月之暗面所有依据其自身许可分发。Deltafin 是独立项目与月之暗面无关联。这不是给普通用户的工具但如果你是个看到“1.7 TB 模型在 64GB 机器上跑起来”会眼睛发亮的硬件爱好者这可能是今年最值得玩的开源项目之一。

相关新闻

接入9000AI联合市场部以后会发生什么?从经营目标到真实市场反馈

接入9000AI联合市场部以后会发生什么?从经营目标到真实市场反馈

" 经营主体接入9000AI联合市场部以后,首先发生的变化,是分散的产品、客户、目标、资产与约束被组织进同一张经营地图。系统由此识别当前市场问题,把方向性经营意图转化为可运行、可观察、可评价的阶段结果,再围绕结果生成关键…

2026/8/13 20:25:59 阅读更多 →
商业银行核心系统架构设计与分布式实践

商业银行核心系统架构设计与分布式实践

1. 商业银行核心系统建设概述 商业银行核心系统是支撑银行各项业务运转的"心脏",它涵盖了存款、贷款、支付结算、会计核算等基础业务功能模块。在数字化转型浪潮下,传统核心系统面临着性能瓶颈、扩展性不足、业务响应慢等挑战。我们团队在过去…

2026/8/13 20:26:50 阅读更多 →
ADR: Agentic AI Detection and Response

ADR: Agentic AI Detection and Response

ADR(智能体AI检测与响应)是一个面向AI智能体的企业安全系统。它帮助组织保护面向员工的智能体,如Cursor、Claude Code和Codex,以及面向客户的智能体,如AI客服助手。 ADR (Agentic AI Detection and Response) is an en…

2026/8/12 18:06:20 阅读更多 →

最新新闻

PyTorch训练可视化:TensorBoard核心API详解与实战技巧

PyTorch训练可视化:TensorBoard核心API详解与实战技巧

1. 项目概述:为什么我们需要TensorBoard来“照亮”PyTorch的训练过程? 如果你和我一样,从早期的PyTorch一路用过来,肯定经历过这样的场景:模型训练启动了,终端上日志一行行地滚动,loss值在下降&…

2026/8/13 22:28:09 阅读更多 →
知网查重降重实战:从机制理解到系统性改写策略

知网查重降重实战:从机制理解到系统性改写策略

1. 从“降重”到“改写”:理解知网查重的底层逻辑每次临近毕业季,总能看到不少同学对着知网查重报告上那一片飘红的文字愁眉不展。大家最关心的问题,往往就是标题里这个:“降低知重最有效的方法,至少降低10%”。作为一…

2026/8/13 22:28:09 阅读更多 →
半导体器件4——MOSFET

半导体器件4——MOSFET

总结在半导体表面生长一层绝缘的氧化层,再在上面做金属栅极。栅极与导电沟道之间是绝缘的,靠电场感应来开通,而不是靠电流注入。解决问题电压控制,高输入阻抗,栅极几乎不需要持续电流,维持导通不耗能。开关…

2026/8/13 22:28:09 阅读更多 →
从数据采集到精准 ECD 计算:Cemsol 全流程数字化闭环的技术拆解

从数据采集到精准 ECD 计算:Cemsol 全流程数字化闭环的技术拆解

前言 固井是决定井筒完整性与油气井寿命的关键工程环节。过去国内长期面临井下工况数据难采集、计算依赖经验公式、国外软件采购运维成本高和数据主权风险等问题。中海油服历时十余年攻关,推出国内首个云端互联固井工程软件“海恒”Cemsol,以KES数据库为…

2026/8/13 22:28:09 阅读更多 →
自习室座位还能这样管:Spring Boot + Vue 高校自习室预约系统实现--源码54719

自习室座位还能这样管:Spring Boot + Vue 高校自习室预约系统实现--源码54719

项目概览项目项内容后端框架Spring Boot前端框架Vue.js开发语言Java数据库MySQL核心业务自习室预约、取消预约、学习计划、签到、积分兑换、黑名单管理痛点分析:座位紧张时,管理规则必须系统化高校自习室常见问题包括预约不便、座位占用不透明、资源浪费…

2026/8/13 22:28:09 阅读更多 →
C++类型安全ORM:sqlpp11编译期检查与MySQL实战指南

C++类型安全ORM:sqlpp11编译期检查与MySQL实战指南

1. 为什么我们需要一个“类型安全”的ORM? 在C的后端开发里,数据库操作是个绕不开的活儿。很多人的起点是直接用原生的数据库客户端库,比如MySQL Connector/C或者libpqxx,写出来的代码大概是这样的: std::string sql…

2026/8/13 22:27:09 阅读更多 →

日新闻

Visual Studio新建项目解决方案为空:系统性排查与修复指南

Visual Studio新建项目解决方案为空:系统性排查与修复指南

1. 问题现象与本质剖析如果你是一位.NET开发者,或者正准备踏入这个领域,那么Visual Studio(后面简称VS)绝对是你绕不开的伙伴。但有时候,这个伙伴会跟你开一个不大不小的玩笑:你满怀期待地点击“创建新项目…

2026/8/13 0:00:09 阅读更多 →
长春建设厅网站:普通人买房办事必看的真实指南与避坑攻略

长春建设厅网站:普通人买房办事必看的真实指南与避坑攻略

说实话,每次提起“长春建设厅网站”这几个字,我心里都挺有感触的。不是因为它有多高大上,也不是因为那里藏着什么不可告人的秘密,恰恰相反,是因为它太“接地气”了,或者说,它是咱们普通人想要在这个城市好好生活、安稳买房时,必须得翻过的一座“数据山”。很多新朋友第…

2026/8/13 0:00:09 阅读更多 →
Windows家庭版远程桌面多用户破解完整指南:RDPWrap终极解决方案

Windows家庭版远程桌面多用户破解完整指南:RDPWrap终极解决方案

Windows家庭版远程桌面多用户破解完整指南:RDPWrap终极解决方案 【免费下载链接】rdpwrap.ini RDPWrap.ini for RDP Wrapper Library by StasM 项目地址: https://gitcode.com/GitHub_Trending/rd/rdpwrap.ini 你是否曾为Windows家庭版无法支持多用户远程桌面…

2026/8/13 0:00:09 阅读更多 →

周新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码(维护中 rm repo) 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/13 2:38:34 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/13 10:41:52 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身,而应重视模型外的系统搭建,即Harness。提出AgentModelHarness的实用公式,详细介绍Harness的四个层次:持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/13 10:41:51 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/13 10:41:50 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/13 10:41:49 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/13 10:41:49 阅读更多 →