DeepSeek V4-Pro 转正:号称追平 Claude Fable 5,但跑分只有一家在说
一句话总结DeepSeek V4-Pro 旗舰模型今天正式 GAAgent 能力据报暴涨DeepSWE 从 12.8 飙到 62.7价格比 Claude Fable 5 便宜约 46 倍——但所有跑分都是 DeepSeek 自己发的还没有任何第三方验证过。便宜是真的强不强得再等等。导语你的 API 账单还好吗如果你是一个天天挂着 Claude Code 或者 GPT 写代码的人最近几个月大概率有过一个念头“这 API 账单能不能便宜点”Anthropic 的 Fable 5 输出 token 要 $50 每百万——跑一轮复杂的 agent 工作流几十刀就没了。GPT-5.6 Luna 刚降了价输入 $0.2/M 输出 $1.2/M已经很有诚意了。但 DeepSeek V4-Flash 的 $0.14/$0.28 直接把地板价又踩穿了一层。然后今天8 月 12-13 日DeepSeek 的旗舰模型 V4-Pro 也正式转正了——版本号 0813从预览版变成了 GAGeneral Availability。号称 Agent 能力暴涨号称追平甚至部分超越 Claude Fable 5号称只要 Fable 5 的 1/46 价格。听起来是不是太好了所以这篇就帮你看懂什么是真的、什么有水分、什么完全还没验证。想自己动手试 官方定价页DeepSeek API Pricing 多供应商入口OpenRouter — DeepSeek V4 Pro KOL 快评Simon Willison — V4 Pro 0813 详细验证报告The Cherry Creek News — 0813 GA 分析 今天到底发生了什么一句话DeepSeek V4-Pro 从预览版转正成正式版了。具体说DeepSeek 在自己的 API 定价页上把deepseek-v4-pro端点的版本号更新成了DeepSeek-V4-Pro-0813。OpenRouter 也同步上线描述里白纸黑字写着 “This is the GA release of DeepSeek V4 Pro”。同时DeepSeek Chat 网页版和客户端也用上了这个版本——普通用户打开就能免费用到DeepSeek 至今没有消费级付费订阅chat 是完全免费的。模型本身没有架构变化仍然是 MoE混合专家架构简单说就是总参数巨大但每次推理只激活一小部分专家上场1.6 万亿总参数、490 亿激活100 万 token 上下文窗口最大输出 38.4 万 token。MIT 开源许可。这些都和 4 月 24 日预览版发布时一致。变的是后训练和 Agent 能力。DeepSeek 自己发布了一组对比图表——把 0813 和 4 月的预览版做了基准对比基准预览版0813 GA涨幅Terminal-Bench 2.172.187.915.8CyberGym52.783.330.6DeepSWE12.862.749.9AutomationBench12.831.819.0DSBench-Hard31.167.236.1DeepSWE 从 12.8 涨到 62.7——接近 50 个百分点的跳升这种增幅在 AI 基准里几乎闻所未闻。但请先记住这个数字后面会说到它的来源问题。有意思的是这次 GA 还有一个家务事的背景。7 月 31 日 DeepSeek 把更便宜的 V4-Flash 先转正了公测版结果 Flash 在 9 项 Agent 基准上反超了自己的旗舰大哥 Pro 预览版。旗舰模型被自家小弟打脸两周后 V4-Pro-0813 就带着暴涨的 Agent 跑分来了——核心叙事就是旗舰夺回了 Agent 王座。DeepSeek 官方没这么说过但这个时间线和数据走向你品。 便宜到什么程度先把那个1/57的口号掰扯清楚网上流传一个说法“V4-Pro 是 Fable 5 价格的 1/57”。这个数字有没有道理有但它是被高度压缩过的。kingy.ai 做了个事实核查结论是这样的输出 token 单独算V4-Pro $0.87/M vs Fable 5 $50/M确实是大约 1/57输入 token 单独算V4-Pro $0.435/M vs Fable 5 $10/M大约是 1/23混合负载实际算输入输出综合大约1/46所以异常便宜这个定性判断完全成立——但1/57把三个不同口径的数字压缩成了一个严格来说是误导。更准确的说法是“大约 1/46”。给你一个更直观的参照模型输入 $/M输出 $/M备注DeepSeek V4-Pro$0.435$0.87永久价原价 $1.74/$3.48DeepSeek V4-Flash$0.14$0.28比 Pro 还便宜 3 倍GPT-5.6 Luna$0.2$1.2刚降过价Claude Fable 5$10$50前沿旗舰Kimi K3$3$15中国同梯竞品5 月 22 日DeepSeek 把 V4-Pro 的 75% 促销折扣变成了永久价——不是限时活动了是长期 list price。这意味着你可以放心签 12 个月的企业合同了不用担心下个月价格弹回去。但是总是有但是的DeepSeek 定价页上同时挂了一条声明——“计划在近期上调整体 API 定价预计会有显著增长”。具体涨多少、什么时候涨都没说。所以当前这个价格更像是窗口期价格而不是永久承诺。 Agent 跑分暴涨先看看数据是怎么来的回到那个 DeepSWE 从 12.8 飙到 62.7 的数字。这个增幅大不大大得离谱。能不能信目前只能信一半——“数字确实是 DeepSeek 发的”但有没有那么强还没有任何人独立验证过。几个事实帮你判断这些数据的质量来源是 DeepSeek 自己的对比图表通过官方 WeChat 群和 X 账号发布被博客转载传播。Reddit 上有人搬运被版主以低质量为由删除了benchable.ai 上该模型的页面是空的——第三方基准平台还没有任何结果DeepSeek 官方 changelog 没有 GA 发布的条目——最后一次更新还停在 7 月 31 日 Flash 公测的公告0813 的开源权重还没发布——HuggingFace 上仍然托管的是 4 月预览权重月下载超 140 万次的也是那个旧版本对比基线是自家预览版不是竞品——也就是说涨了 50 个百分点的参照物是自己的旧版本不是 Fable 5 或 GPT-5.6更值得注意的一个细节那组 Agent 图表用的是 Terminal-Bench2.1而 4 月预览版发布时的标准基准表用的是 Terminal-Bench2.0——不同版本分数不可直接比较。所以你看到预览版 Terminal-Bench 67.9和0813 Terminal-Bench 87.9时别急着算差值它们用的可能不是同一套卷子。Simon Willison知名 AI 博主在他的博客里提到一个耐人寻味的细节他测试时发现 V4-Pro 在不同推理强度low/medium/high下生成的图片差异极大——“没有其他模型有这种程度的差异”。这意味着推理强度对输出质量的影响可能比其他模型显著得多选对档位很重要。总结一下数据可信度DeepSeek 自己的标准基准4 月发布的 SWE-Bench、LiveCodeBench 等已经被多个第三方验证过大体靠谱。但 0813 的 Agent 大幅提升数据目前完全是孤证——只有 DeepSeek 一家在说没有任何人复现。‍ 开发者社区怎么说Hacker News 是这次讨论的主战场。V4 系列今年 4 月首发的主帖拿到了 2091 分和 1607 条评论——HN 近期最热的 AI 话题之一。社区反馈大致是6 成正面、3 成谨慎、1 成负面。说好的那拨人主要激动于成本“在 max reasoning 设置下我的 credit 余额几乎不动”——这是真实 API 用户反馈有人估算加上 agentic 工作流中典型的缓存命中率实际花费比 Claude Opus 便宜约 60 倍DeepClaude 项目把 V4-Pro 塞进 Claude Code 的 agent loop 里跑在 HN 拿了 678 分说明用 DeepSeek 引擎跑 Claude Code的需求真实存在LiveCodeBench 93.5 分是同表所有模型最高Codeforces rating 3206 也压过 GPT-5.4 的 3168说不好的那拨人给了一个特别有杀伤力的真实对比“Deepseek 4 pro跑了 12 分 02 秒花了 $0.12——有 bug。Grok 4.6跑了 3 分 18 秒花了 $1.41——没 bug。”十二美分跑出来一个带 bug 的结果和一块四跑出来一个干净的结果——这个对比精准地命中了便宜 ≠ 好的痛点。当然正如另一位 HN 用户说的“这是非确定性系统单次试验不能大幅更新你的先验。” 一个样本说明不了什么但至少提醒我们跑分和实际使用体验之间可以有巨大鸿沟。还有几个反复被提到的关切隐私政策“DeepSeek 的隐私政策异常糟糕——他们可以用你的 prompt 和补全做训练。” 对企业级敏感数据来说这是一条硬伤推理速度高负载时段明显变慢。DeepSeek 的计算资源只有约 2 万张 H100在高并发下推理会慢到爬行基准方法论质疑有人指出harness测试框架的权重几乎和模型本身一样大意思是你换个测试工具链可能分数完全不一样 几个你该知道的信号在你考虑要不要切到 V4-Pro 之前有几个信号值得放在心上第一DeepSeek 7 月的 token 消耗量已经仅次于 Anthropic8 月大概率登顶。这意味着它正在获取全球最大规模的用户交互数据——这些数据直接喂给后训练可能形成用户越多→数据越多→模型越强→用户更多的飞轮。从行业竞争角度看这是一个值得关注的结构性优势。第二V4-Flash 可能是更务实的选择。Flash 只要 $0.14/$0.28 每百万 token比 Pro 还便宜 3 倍而且 Terminal-Bench 2.1 已经到了 82.7——和 Pro 的 87.9 差距不大。如果你的工作负载是日常编码、分类、摘要、RAG 检索Flash 的性价比可能比 Pro 更高。Pro 真正的价值在于最难的 agentic 长链任务那种需要几百步工具调用的场景。第三0813 的开源权重还没出来。如果你是要自托管的研究者或企业现在能用的还是 4 月的预览权重。DeepSeek 没说什么时候发 0813 权重也没说 GA 版和预览版在模型本体上是否有区别——可能只是后训练不同也可能是全新 checkpoint。第四今天是三连发的一天。除了 V4-Pro GAGrok 4.6 也发布了Intelligence Index 61只有 GPT-5.6 Sol 价格的五分之一阿里也上线了第一个开源 Qwen-Max。三家公司同日发旗舰——AI 模型的迭代节奏已经从季度旗舰加速到月度旗舰了。这对消费者是好事但也意味着你现在选的模型下个月可能就不再是性价比最优了。把话说明白回到开头那个问题“这 API 账单能不能便宜点”答案是能而且便宜得超出预期。V4-Pro 的定价在当前市场上确实是碾压级的——同等质量的工作负载花不到 Fable 5 的零头这不是营销话术是定价页上白纸黑字的数字。Reuters 引用研究机构的结论也说DeepSeek 是知名模型中运行成本最低的。但便宜和好用之间还有一段路。Agent 能力暴涨的数据目前只有 DeepSeek 自己在说benchable.ai 空空如也社区实测也有十二美分跑出 bug的案例。V4-Pro 在编程基准上的实力LiveCodeBench 全场最高、Codeforces 领先 GPT-5.4是多方验证过的但 0813 新增的 Agent 提升是否如报所述还需要时间检验。一个务实的做法先用起来用你自己的真实工作负载测别只看跑分表。DeepSeek Chat 是免费的API 成本低到你可以在 max reasoning 下跑几十轮都不心疼。如果在你自己的任务上 V4-Pro 的表现够用——那这个价格就是真的香。如果在你的场景下频繁出 bug 或者速度慢到影响效率——那再便宜也不值。毕竟AI 模型是非确定性系统。你的场景、你的 prompt、你的任务复杂度才是最终的决定因素。跑分表只是参考——而参考的价值取决于参考本身站不站得住。参考来源DeepSeek API 定价页一手/官方— https://api-docs.deepseek.com/quick_start/pricingOpenRouter DeepSeek V4 Pro 模型页一手/平台— https://openrouter.ai/deepseek/deepseek-v4-proUnite.AI — DeepSeek Ships V4 Pro as Its Flagship Model Leaves Preview垂直媒体— https://www.unite.ai/deepseek-ships-v4-pro-as-its-flagship-model-leaves-preview/Wccftech — V4-Pro-0813 定价与 token 消耗分析垂直媒体— https://wccftech.com/deepseek-prices-its-new-v4-pro-0813-model-at-0-87-per-1-million-output-tokens-as-the-high-flying-chinese-ai-lab-wows-with-its-soaring-token-consumption/Simon Willison’s Weblog — V4 Pro 0813 快评社区/KOL— https://simonwillison.net/2026/Aug/12/deepseek-v4-pro-0813/The Cherry Creek News — 0813 GA 详细验证报告垂直/分析— https://thecherrycreeknews.com/deepseek-v4-pro-0813-ga-pricing-benchmarks-analysis-cherry_creek/DeepSeek Benchmarks 2026 — 标准基准全表垂直/分析— https://deepseekai.guide/news/deepseek-benchmarks-2026/Hacker News V4 主帖社区— https://news.ycombinator.com/item?id47884971作者lusca版本lusca-report-blog v1.0.0出处https://github.com/yjmm10/lusca-skill/tree/main/skills/lusca-report-blog

相关新闻

数学建模竞赛实战指南:从问题拆解到模型实现

数学建模竞赛实战指南:从问题拆解到模型实现

1. 从“妈妈杯”到实战:一份写给建模新手的万字拆解指南如果你正在为2026年的MathorCup(俗称“妈妈杯”)数学建模挑战赛做准备,或者对数学建模竞赛跃跃欲试,那么你大概率已经看过不少“三天速成”、“万能模板”之类的…

2026/9/20 6:11:03 阅读更多 →
深度求索开源AlphaBrain Platform:具身智能“大脑”全家桶解析与实践指南

深度求索开源AlphaBrain Platform:具身智能“大脑”全家桶解析与实践指南

1. 从“开源硬件”到“开源大脑”:一场具身智能的范式转移最近,特斯拉开源其部分硬件设计资料的消息,在科技圈和硬件爱好者中激起了不小的波澜。很多人第一时间跑去下载,琢磨着能不能复刻点什么。但在我看来,这波“开源…

2026/9/20 10:36:55 阅读更多 →
做聊城网站建设方案不仅要面子好看,更要里子扎实,这才是中小企业破局的关键

做聊城网站建设方案不仅要面子好看,更要里子扎实,这才是中小企业破局的关键

很多聊城的老少爷们,还有那些正在创业、准备在网络上大展拳脚的企业主朋友,经常会问我一个问题:到底需不需要做一个网站?或者更直接点问,花个几千甚至几万元做一个网站,到底能给我带来什么实际的好处?是挂在朋友圈里撑场面,还是真能带来客户和订单?说实话,在短视频满…

2026/9/21 17:27:43 阅读更多 →

最新新闻

合法合规的轻量级媒体播放器开发指南

合法合规的轻量级媒体播放器开发指南

我无法根据该标题生成符合要求的博文内容。原因如下:标题“橙子电视绿化版_1.0_20240417绿化精简”属于典型的应用软件非官方修改版本命名格式,其中“绿化版”“精简版”等表述,在国内软件分发与版权合规语境下,普遍指向对正版软件…

2026/9/24 0:04:07 阅读更多 →
OpenCV侧脸检测:haarcascade-profileface.xml使用与参数调优

OpenCV侧脸检测:haarcascade-profileface.xml使用与参数调优

简介:OpenCV 4.x的侧面人脸检测专用Haar级联分类器,以XML格式封装了基于AdaBoost训练的预训练模型,适合需要快速在图像或视频流中识别侧脸、进行人脸对齐或姿态分析的开发者直接集成。压缩包共2个文件,核心为XML格式的级联分类器&…

2026/9/24 0:04:04 阅读更多 →
DEiT图像分类实战:数据高效Transformer的训练与推理

DEiT图像分类实战:数据高效Transformer的训练与推理

简介:面向深度学习与计算机视觉学习者,这份DEiT实战资源围绕Facebook提出的DeiT模型,展示如何在不依赖外部数据集的情况下,利用知识蒸馏策略完成ImageNet级别的高效训练,并落地到图像分类任务中。DeiT通过引入蒸馏令牌…

2026/9/24 0:03:40 阅读更多 →
企业级项目dragonballz_e159-1的技术架构与实现方案

企业级项目dragonballz_e159-1的技术架构与实现方案

1. 项目背景解析"dragonballz_e159-1"这个项目名称看似简单,实际上包含了丰富的技术内涵。从命名规则来看,这很可能是一个涉及数据处理或系统集成的技术项目。这类编号通常出现在企业级应用开发、自动化脚本或数据处理流水线中,其中…

2026/9/24 0:03:39 阅读更多 →
Numba 类型推断机制详解:从 Numba IR 到编译期类型重建的完整原理与实践

Numba 类型推断机制详解:从 Numba IR 到编译期类型重建的完整原理与实践

编译器高性能计算 【免费下载链接】numba NumPy aware dynamic Python compiler using LLVM 项目地址: https://gitcode.com/gh_mirrors/nu/numba 点击查看 免费下载 导读 Numba 是基于 LLVM 的 NumPy 感知的动态 Python 编译器,其核心挑战在于&#x…

2026/9/24 0:03:39 阅读更多 →
JavaWeb购物车系统实现:基于Session存储的完整工程示例

JavaWeb购物车系统实现:基于Session存储的完整工程示例

简介:这是一份面向Java Web初学者的简易购物车系统案例,完整演示了基于Servlet与Tomcat的商品选购流程;案例来自课程设计或实验场景,需求中要求设计商品展示页面,点击“添加到购物车”超链接后进入Servlet记录选购信息…

2026/9/24 0:02:36 阅读更多 →

日新闻

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为…

2026/9/24 0:00:19 阅读更多 →
单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

简介:一份基于单细胞RNA测序数据的细胞类型注释算法研究Python毕业设计源码,针对计算机相关专业正在做毕设或需要项目实战的学习者,可用于课程设计与期末大作业。项目代码完整、经导师指导评审通过,可直接运行,覆盖数据…

2026/9/24 0:00:19 阅读更多 →
C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

第一次在项目里被反射卡住,是在一个老旧的WinForms模块里:几十个类依赖PropertyChanged通知,运行时反射读属性、发通知,每次启动慢半拍不说,一上.NET Native/AOT裁剪模式几乎全面崩盘。后来我把这段逻辑全部改成C#源生…

2026/9/24 0:00:19 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/23 4:55:02 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/23 4:49:06 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/23 9:53:41 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/23 9:53:40 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/23 9:53:40 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/23 9:53:40 阅读更多 →