Luna 输入降到 0.2 美元:模型路由经济学和杰文斯悖论
古董级程序员大厂出来后一直在创业公司现在仍在一线做 AI 相关开发。这个专栏补的是 AI 时代程序员容易忽略的硬底座这篇从账单出发把模型路由这件事讲成一道成本工程题。2026 年 7 月 30 日OpenAI 调整 GPT-5.6 系列 API 价格轻量级 Luna 输入从每百万 token 1 美元降到 0.2 美元降 80%输出从 6 美元降到 1.2 美元均衡档 Terra 输入从 2.5 美元降到 2 美元、输出从 15 美元降到 12 美元降 20%旗舰 Sol 不降价但新增 Fast 模式处理速度最高 2.5 倍、收费 2 倍。到 8 月初OpenAI 宣布月活用户破 10 亿、企业客户 200 万。对写代码的人来说这条新闻值得拆成两件事看一是同一个任务用哪档模型成本差一个数量级这是路由问题二是单价越便宜总需求反而可能越大这是杰文斯悖论。这篇先把第一件事做成能复算的账本再讲第二件事为什么影响你的架构判断。先摆价格三档模型不是三个版本是三条产品线模型定位输入每百万 token输出每百万 token本次调整Luna高频、低延迟、量大$0.20$1.20降 80%Terra均衡日常负载约 GPT-5.5 性能、一半成本$2.00$12.00降 20%Sol旗舰推理、复杂编码与科学计算约 $5未变约 $30未变新增 2.5x Fast 模式收费 2 倍注意 Sol/Terra/Luna 是三条各自迭代的产品线不是同一个模型的“大中小杯”。OpenAI 的意图是让每个档位按自己的节奏升级价格锚定的是使用场景而不是版本号。这对工程选型是好事你可以把“精度”和“成本”解耦按任务特性路由。成本模型两行公式先算清楚再选型一个 API 调用的成本由输入和输出分开计价单次成本 输入 token × 输入单价 输出 token × 输出单价真实账单通常还要乘上重试次数Agent 场景还要把每一轮重发的上下文算进去Codex 这类 Agent 每轮都会重发整个上下文缓存命中率直接决定真实单价——我们之前跑 deepseek-v4-flash 时缓存命中 94%靠的就是这个。先把不命中缓存的基准算明白再把缓存当作折扣项。拿一个月 5000 万输入 token、1000 万输出 token 的固定流量算模型月成本降价后相对 LunaLuna50 × 0.2 10 × 1.2 $221xTerra50 × 2 10 × 12 $22010xSol50 × 5 10 × 30 $55025x同一个流量Luna 和 Sol 相差 25 倍。放到 Agent 场景更直观一次典型步骤 6 万 token 上下文进、3000 token 计划补丁出Luna 约 1.6 美分Terra 约 15.6 美分Sol 约 39 美分。一天一千个步骤Luna 16 美元Terra 156 美元。选错档位的代价是按天计而不是按月计。路由决策按任务特性分流而不是按模型名气路由不是“贵的模型永远更好”。同一个任务能不能被便宜模型高质量完成取决于任务的可验证性和失败代价任务特性建议档位理由复杂重构、跨模块设计、高风险变更Sol一步到位比十轮返工便宜错误直接进主干日常 CRUD、单文件改动、有测试兜底Terra性价比均衡约 5.5 级性能半价批量分类、抽取、重试次数多的任务Luna量大、可重试、失败代价低单价决定总成本需要 2.5 倍速的交互/同步场景Sol Fast延迟敏感才值得付两倍价伪代码可以这样写def route(task: Task) - str: if task.requires_deep_reasoning or task.failure_cost high: return sol if task.is_batch or task.retryable: return luna return terra真正的路由逻辑不会只有三行但核心判断就两个问题这一步错了会怎样以及这一步能重试多少次。能重试的交给便宜的不能重试的交给贵的其余按延迟要求排。失败场景账单爆炸的三个典型写法无上限重试把 Luna 用在抽取任务上解析失败就重试 3 次等于把 4 倍成本写进代码。重试要带退避、上限和降级。上下文重发不看缓存Agent 每轮重发 10 万 token 上下文不命中缓存时Luna 每轮光上下文就 2 美分一万轮就是 200 美元。路由之前先确认 API 的缓存输入档位和命中率。全员 Sol团队习惯性把复杂任务默认给旗舰模型账单按 25 倍跑。先用 Terra 跑通、用测试兜底只有测试证明 Terra 不够才升级。验收清单部署前逐条勾每个调用点标注了预期模型档位而不是全局默认重试有上限、退避和降级路径输入/输出 token 有埋点月账单可以按任务类型拆分批量任务先在小样本上对比 Luna 与 Terra 的质量差异缓存命中率进入监控指标低于阈值报警杰文斯悖论单价下降为什么会让总需求上升接下来是产业层面。摩根士丹利 8 月 3 日发布报告《开放权重模型与三种未来情景》核心观点是开放权重模型不会削弱 AI 算力需求反而可能推高总需求。这正是不懂经济学的人容易反直觉的地方——杰文斯悖论19 世纪经济学家威廉·斯坦利·杰文斯发现瓦特改良蒸汽机让煤炭效率大幅提升后煤炭总消耗不降反升因为更便宜的能源催生了更多用途。同样的逻辑套在 token 上单次推理变便宜企业会把 AI 塞进更多任务——日志分类、客服首响、代码预检、数据清洗、边缘设备——每个新用途都产生新的 token 和算力需求。摩根士丹利特别强调两点开放权重不等于开源许可证和再分发规则完全不同开放权重也不等于免费运行它仍需 GPU、电力和运维。所以“开源模型便宜 → 闭源完蛋”是错误推论更准确的推论是“便宜 → 普及 → 总用量上升”。同期的数字在互相印证微软、亚马逊、谷歌、Meta 四家 2026 年合计 AI 基础设施投入约 7000 亿美元中信证券 8 月 4 日也判断开源模型能力提升带来“智能平权”和“Token 平价”。DeepSeek V4-Flash 免费、Meta Muse Code 贡献者档输出 0.2 美元/百万 token——闭源厂商的降价不是慈善是在给整个市场“以价换量”赌的是杰文斯悖论在自己这边成立。对程序员的两条判断第一条模型路由会成为新的基本功。就像早年开发要懂缓存和索引一样现在每个 AI 功能上线前都要回答“为什么用这个模型、贵在哪、错了会怎样”。这不是选型洁癖是成本工程。第二条别因为单价降了就放松用量管理。杰文斯悖论的工程版是token 便宜到一定程度团队会忍不住把一切任务都交给 LLM然后总账单和延迟预算一起失控。降价放大了“用量管理”的重要性而不是取消了它。架构上值得做的动作是给模型调用加配额、把批量任务和交互任务分流、让便宜模型成为默认、让贵模型成为例外。观察点放在三件事上Sol 维持原价但新增 2.5x Fast 模式说明高端推理和低延迟需求仍然稀缺开放权重模型的“Token 平价”会继续挤压闭源入门档以及——当 Luna 和 DeepSeek V4-Flash 都便宜到可以忽略单价时真正决定账单的变量就只剩缓存命中率和重试次数了。

相关新闻

RyTuneX 系统优化终极指南:免费开源工具让 Windows 提速 40% 的完整玩法

RyTuneX 系统优化终极指南:免费开源工具让 Windows 提速 40% 的完整玩法

RyTuneX 系统优化终极指南:免费开源工具让 Windows 提速 40% 的完整玩法 【免费下载链接】RyTuneX RyTuneX is a cutting-edge optimizer built with the WinUI 3 framework, designed to amplify the performance of Windows devices. Crafted for both Windows 10…

2026/8/13 15:44:19 阅读更多 →
QQ空间备份工具GetQzonehistory实操指南:历史说说一键导出,把青春记忆永久保存

QQ空间备份工具GetQzonehistory实操指南:历史说说一键导出,把青春记忆永久保存

QQ空间备份工具GetQzonehistory实操指南:历史说说一键导出,把青春记忆永久保存 【免费下载链接】GetQzonehistory 获取QQ空间发布的历史说说 项目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory QQ空间里存着不少人的青春&#x…

2026/8/13 15:43:19 阅读更多 →
大模型本地部署与微调实战:从Ollama、vLLM到LoRA的完整指南

大模型本地部署与微调实战:从Ollama、vLLM到LoRA的完整指南

最近在尝试本地部署和微调大模型时,发现很多教程要么过于理论,要么步骤跳跃,对于想从零开始实践的开发者来说,总感觉缺少一个能串联起所有关键环节的“实战手册”。本文将作为“从零构建大模型”系列的第二篇附加内容,…

2026/8/13 15:43:19 阅读更多 →

最新新闻

GEO生成式AI搜索是什么?2026年搜索优化方式影响力排行

GEO生成式AI搜索是什么?2026年搜索优化方式影响力排行

开篇:行业背景与内容说明用户的搜索习惯正在被AI搜索引擎改写。越来越多的人不再逐页翻看搜索结果,而是直接向ChatGPT Search、Perplexity、Google AI Overviews提问"哪家产品靠谱""哪些厂商有权威认证",AI给出的答案会直…

2026/8/13 18:59:16 阅读更多 →
Route性能优化:缓存路由器实现与自动失效策略

Route性能优化:缓存路由器实现与自动失效策略

Route性能优化:缓存路由器实现与自动失效策略 【免费下载链接】route Fast PSR-7 based routing and dispatch component including PSR-15 middleware, built on top of FastRoute. 项目地址: https://gitcode.com/gh_mirrors/route1/route GitHub 加速计划…

2026/8/13 18:59:16 阅读更多 →
Headlamp RBAC权限管理终极指南:简单高效的Kubernetes访问控制

Headlamp RBAC权限管理终极指南:简单高效的Kubernetes访问控制

Headlamp RBAC权限管理终极指南:简单高效的Kubernetes访问控制 【免费下载链接】headlamp A Kubernetes web UI that is fully-featured, user-friendly and extensible 项目地址: https://gitcode.com/GitHub_Trending/he/headlamp Headlamp是一款功能强大且…

2026/8/13 18:59:16 阅读更多 →
如何快速掌握Fusion框架:面向开发者的完整Luau开发教程

如何快速掌握Fusion框架:面向开发者的完整Luau开发教程

如何快速掌握Fusion框架:面向开发者的完整Luau开发教程 【免费下载链接】Fusion Futuristic Luau for every universe. 项目地址: https://gitcode.com/gh_mirrors/fusion4/Fusion Fusion是一款面向未来的Luau框架,专为各种开发场景设计&#xff…

2026/8/13 18:59:16 阅读更多 →
斯坦福AI速查表:5分钟掌握人工智能核心概念

斯坦福AI速查表:5分钟掌握人工智能核心概念

斯坦福AI速查表:5分钟掌握人工智能核心概念 【免费下载链接】stanford-cs-221-artificial-intelligence VIP cheatsheets for Stanfords CS 221 Artificial Intelligence 项目地址: https://gitcode.com/gh_mirrors/st/stanford-cs-221-artificial-intelligence …

2026/8/13 18:59:16 阅读更多 →
RVC变声器终极指南:5分钟快速上手,10分钟训练专属AI音色

RVC变声器终极指南:5分钟快速上手,10分钟训练专属AI音色

RVC变声器终极指南&#xff1a;5分钟快速上手&#xff0c;10分钟训练专属AI音色 【免费下载链接】Retrieval-based-Voice-Conversion-WebUI Easily train a good VC model with voice data < 10 mins! 项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-…

2026/8/13 18:58:16 阅读更多 →

日新闻

Visual Studio新建项目解决方案为空:系统性排查与修复指南

Visual Studio新建项目解决方案为空:系统性排查与修复指南

1. 问题现象与本质剖析如果你是一位.NET开发者&#xff0c;或者正准备踏入这个领域&#xff0c;那么Visual Studio&#xff08;后面简称VS&#xff09;绝对是你绕不开的伙伴。但有时候&#xff0c;这个伙伴会跟你开一个不大不小的玩笑&#xff1a;你满怀期待地点击“创建新项目…

2026/8/13 0:00:09 阅读更多 →
长春建设厅网站:普通人买房办事必看的真实指南与避坑攻略

长春建设厅网站:普通人买房办事必看的真实指南与避坑攻略

说实话,每次提起“长春建设厅网站”这几个字,我心里都挺有感触的。不是因为它有多高大上,也不是因为那里藏着什么不可告人的秘密,恰恰相反,是因为它太“接地气”了,或者说,它是咱们普通人想要在这个城市好好生活、安稳买房时,必须得翻过的一座“数据山”。很多新朋友第…

2026/8/13 0:00:09 阅读更多 →
Windows家庭版远程桌面多用户破解完整指南:RDPWrap终极解决方案

Windows家庭版远程桌面多用户破解完整指南:RDPWrap终极解决方案

Windows家庭版远程桌面多用户破解完整指南&#xff1a;RDPWrap终极解决方案 【免费下载链接】rdpwrap.ini RDPWrap.ini for RDP Wrapper Library by StasM 项目地址: https://gitcode.com/GitHub_Trending/rd/rdpwrap.ini 你是否曾为Windows家庭版无法支持多用户远程桌面…

2026/8/13 0:00:09 阅读更多 →

周新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑&#xff1a;baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码&#xff08;维护中 rm repo&#xff09; 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/13 2:38:34 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片&#xff1a;Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/13 10:41:52 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身&#xff0c;而应重视模型外的系统搭建&#xff0c;即Harness。提出AgentModelHarness的实用公式&#xff0c;详细介绍Harness的四个层次&#xff1a;持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/13 10:41:51 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速&#xff1a;macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/13 10:41:50 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南&#xff1a;3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗&#xff1f;ncmdump解密工具帮你轻松解决这个困…

2026/8/13 10:41:49 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片&#xff1a;为英语学习 App 打造桌面级学习助手适用平台&#xff1a;HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0&#xff08;API 26 Beta&#xff09;新增了 AgentCard 智能体卡片能力&#xff0c;这是继 HMAF&#xff08;鸿蒙智能体框架&#x…

2026/8/13 10:41:49 阅读更多 →