DeepSeek V4 Pro正式版发布,正面对撞马斯克的Grok 4.6,性能直逼Claude Fable 5
整理 | 屠敏出品 | CSDNIDCSDNnewsDeepSeek 又在深夜“放大招”了。8 月 12 日深夜DeepSeek 悄无声息地把此前一直处于预览状态的 V4 Pro 更新成了正式版模型版本号变为 DeepSeek-V4-Pro-0813。没有发布博客文章也没有一条正式的社交媒体公告。最先让外界发现 Deepseek 有更新动作的是在 DeepSeek API 的模型与价格页面上原本的 deepseek-v4-pro 对应的型号版本被悄悄替换成了 DeepSeek-V4-Pro-0813。目前通过 OpenRouter 已经可以直接查看这一版本https://openrouter.ai/deepseek/deepseek-v4-pro-0813页面显示该模型支持 100 万 Token 上下文输入价格为每百万 Token 0.435 美元输出价格为 0.87 美元。更有意思的是DeepSeek 这次更新并没有提高价格但这可能只是暂时的。因为就在几天前DeepSeek 已经在用户后台发布公告宣布计划于近期整体上调 Deepseek API 服务的定价预计涨幅较大让用户合理安排自身的使用。不过截至目前新的具体价格和生效时间尚未公布。当然价格只是一方面真正让外界兴奋的是 V4 Pro 0813 的性能。从“预览版”到正式版V4 Pro 到底升级了多少DeepSeek V4 Pro 最初是在今年 4 月 24 日以预览版身份发布的。当时DeepSeek 给 V4 Pro 配备了 1.6 万亿总参数、490 亿激活参数并首次将 100 万 Token 上下文作为 V4 系列的标准配置。DeepSeek 当时就把 V4 Pro 的定位放得非常高强调其 Agent、世界知识、代码和推理能力目标是与全球顶级闭源模型竞争。但问题在于此前外界测到的各种成绩其实都是 V4 Pro Preview 的成绩。这意味着过去几个月大家拿来和 Claude、GPT 等模型比较的很可能还是一个“半成品”。如今正式版终于来了DeepSeek 自己给出的对比数据也开始变得相当有意思。从 Deepseek 官方群发布的覆盖 10 项智能体基准测试的横向对比结果来看在 Claude Fable 5 或其他模型占优的 8 项测试里DeepSeek-V4-Pro-0813 与之相比性能差距都十分微小。综合所有测试Fable 5 平均领先幅度为 5.3%。如果剔除「无工具版人类终极考试」这一极端样本DeepSeek 得分 42.7Fable 5 为 53.3存在 10.6% 的差距大幅拉高整体差值剩余项目平均差距仅 2.8%。更值得关注的是在专门考察 AI 编程 Agent 长周期软件工程能力的基准测试 DeepSWE 中DeepSeek-V4-Pro 正式版的表现有了很大的跃升其得分从预览版的 12.8 直接提升至 62.7暴涨近 5 倍。 与传统代码生成测试不同这一基准测试要求模型真正进入一个复杂的开源代码仓库自主理解代码、修改多个文件、运行测试并不断修正最终完成一个完整的软件工程任务。这个变化反映的并不只是模型“写代码更快了”而是它处理复杂软件工程任务、连续调用工具并自主完成多轮修改的能力出现了明显提升。此外在聚焦 AI 网络安全攻防能力的 CyberGym 和面向 AI Agent 自动化能力的 AutomationBenchPublic两项基准测试中DeepSeek-V4-Pro-0813 反超 Fable 5。价格如果性能只是接近那么价格可能才是 V4 Pro 0813 最值得关注的地方。正如上文所述目前 DeepSeek API 给 V4 Pro 的价格是输入0.435 美元 / 百万 Token输出0.87 美元 / 百万 Token缓存命中输入甚至只有 0.003625 美元 / 百万 Token。相较之下Anthropic Fable 5 输入每百万 token 10 美元输出 50 美元。综合折算均价Fable 5 约 30 美元V4 Pro 约 0.65 美元前者成本大约是后者 46 倍。对于规模化使用 AI 工具的企业而言这样的成本差距至关重要。此外据外媒 The Decrypt 分析由于 Fable 5 推理耗时更长、生成文本更多因此其完成单次任务的实际成本差距更大。据 Artificial Analysis 早期时候测算基准测试中单任务成本 Fable 5 达到 3.15 美元而 V4-Flash 仅 3 美分价差约 105 倍。Hugging Face CEO Clem 估算测试的各型号每项任务的成本差异高达 800 倍Claude Fable 5 在基准测试中领先但平均每项任务的成本超过 31 美元而 DeepSeek V4 Flash (max) 的成本仅为 0.04 美元。不过目前还没有 0813 新版 V4 Pro 的单任务成本数据。整体而言拥有能够逼近最顶级的闭源模型的性能同时把成本压到后者的零头开源的 Deepseek 优势不言而喻。马斯克的 Grok 4.6 同期发布值得一提的也就是在今天马斯克为自家新模型站台官宣 Grok 4.6 发布并称其为“智能、快速且性价比极高的产品。”Grok 4.6 同样将重点放在了 AI Agent 和复杂任务上。根据 SpaceXAI 最新收购的 Cursor 官方介绍新模型基于 Grok 4.5 打造重点强化了长时间运行的 Agent以及更复杂的交互和视觉任务能够处理研究、信息分析、跨代码库开发等需要多步骤完成的工作。在性能方面Cursor 表示Grok 4.6 在多项 Agent 编程和知识工作基准测试中达到前沿水平在 Artificial Analysis Intelligence Index 上与 GPT-5.6 Sol 持平。与此同时Grok 4.6 已经登陆 Cursor、Grok Build并可通过 API 以及 OpenRouter、Vercel、Cloudflare 等平台调用价格为每百万输入 Token 2 美元、每百万输出 Token 6 美元。这也让 DeepSeek V4 Pro 和 Grok 4.6 的“同日登场”显得颇有意思一个把价格压到了极低水平一个则试图用更强的 Agent 能力冲击前沿模型。开发者已经开始“实测”了让人颇为关注的是随后有开发者也开始把这两个模型直接放在一起进行实际编程测试。在 HN 讨论区一位名为 jklmnopqrstuvw 的网友直接把 V4 Pro 0813 和 Grok 4.6 放进 Codex CLI对同一个新功能进行开发测试。结果是V4 Pro 0813 花了 12 分 02 秒成本 0.12 美元但出现 BugGrok 4.6 花了 3 分 18 秒成本 1.41 美元没有出现 Bug。这个结果其实比“某个 Benchmark 超过了多少”更有意思。因为它恰恰说明真实的软件开发中模型能力并不是一个简单的分数。当然也有人提醒不应该拿一次实验就给模型下结论。毕竟 Agent 本身具有很强的随机性一次成功或者失败并不能代表模型的整体水平。而面对 DeepSeek-V4-Pro-0813 的到来独立 AI 分析师、前 Hugging Face 研究员 Tiezhen Wang 发帖直言你可能还没有意识到这意味着什么。如果这是真的而且 DS-V4-Pro 还是开源模型那 Opus 甚至 Fable 都要“GG”了 。这意味着得益于 DeepSeek V4 极小的稀疏 KV CacheDeepSeek 有能力以只有 Fable API 价格 1/50 的成本提供与 Fable 同级别的模型同时还能获得远高于 Anthropic 的缓存命中率。最终的总成本甚至可能低 100 倍而模型能力基本处于同一水平。这对存储行业来说是个利好因为 SSD KV Cache 可能会成为标准配置。对整个 AI 行业也是好消息——AI 变得更加便宜意味着会有更多人开始使用 AI而这又会进一步加快需求增长。现在我是真的想问一句接下来会发生什么我们准备好迎接一个 Fable 开源后的世界了吗回看从 2025 年的 R1 到今年的 V4其实 DeepSeek 一直在做一件很类似的事情不是简单追求“我要做一个比所有模型都强的 AI”而是不断把前沿模型的能力往更低的成本区间里压。V4 Pro 0813 的意义可能也不只是“又一个国产大模型发布”。如果 DeepSeek 自己公布的测试结果最终能够得到第三方验证那么这一次真正值得关注的将是一个越来越明显的变化顶级闭源模型与高性价比开源模型之间的性能差距可能正在进一步缩小。参考https://openrouter.ai/deepseek/deepseek-v4-pro-0813https://x.com/Xianbao_QIANhttps://news.ycombinator.com/item?id49274600https://decrypt.co/375507/china-deepseek-upgrades-v4-pro-claude-fable

相关新闻

Google亲自下场力挺:“Go才是AI辅助软件工程理想语言”,却引全网热议

Google亲自下场力挺:“Go才是AI辅助软件工程理想语言”,却引全网热议

编译 | 苏宓出品 | CSDN(ID:CSDNnews)编程语言之争,在技术圈已经吵了三十多年。如今,随着 AI 编程工具越来越强,这场争论也逐渐从“哪种编程语言最强”,演变成了一个新问题:什么样的…

2026/9/23 18:55:59 阅读更多 →
软件开发外包靠谱吗?优缺点和避坑建议

软件开发外包靠谱吗?优缺点和避坑建议

软件外包靠谱吗?软件开发外包可以靠谱,但企业要选对合作方,并把需求、验收、源码和售后写进合同。外包不是单纯找人写代码,而是购买可管理、可验收的项目交付服务。只看低价和口头承诺,风险较高。 ## 一、软件开发外包…

2026/9/24 17:27:28 阅读更多 →
光纤放大器原理与应用:从受激辐射到工程部署全解析

光纤放大器原理与应用:从受激辐射到工程部署全解析

1. 项目概述:从“信号衰减”到“光中继”的跨越在光通信的世界里,信号衰减是一个永恒的敌人。想象一下,你在一根长达数百甚至上千公里的透明管道里,用手电筒打出一束光,希望它能在另一端被清晰地看到。但现实是&#x…

2026/9/24 12:20:21 阅读更多 →

最新新闻

lu,震惊分析实验系统、震惊实验视频分析系统

lu,震惊分析实验系统、震惊实验视频分析系统

震惊反射系统用于分析动物受到突发强刺激后的应激行为,单台计算机可管控 1‑5 个震惊反应箱。除噪声刺激外,还可叠加光、电、气流组合刺激,刺激间隔技术参数1、重量传感器量程:1‑2kg 2、系统架构:主控制器搭配装置控制…

2026/9/24 17:27:31 阅读更多 →
2026 大幅面数码印刷设备行业观察:国产压电写真机技术演进与设备选型参考

2026 大幅面数码印刷设备行业观察:国产压电写真机技术演进与设备选型参考

本文面向广告加工、图文印刷行业从业者,梳理 2026 大幅面数码印刷设备的技术现状,包含压电写真、UV 打印技术拆解,以及工厂设备选型参考。 摘要:随着个性化小批量订单持续释放需求,国内大幅面数码印刷设备行业保持稳步…

2026/9/24 17:27:31 阅读更多 →
用思维赚钱14:求财与财富观的境界

用思维赚钱14:求财与财富观的境界

天下熙熙皆为利来,天下攘攘皆为利往。在这个世界上,芸芸众生,追求经济利益或者说求财,在一定程度上,可以说具有普遍性。追求权色名利,就一般意义上讲,并没有天然的是非对错,都是可以…

2026/9/24 17:27:31 阅读更多 →
双向RNN

双向RNN

如果不加特别说明,RNN的计算一般是从左到右的,即第t步的特征计算只能“看到”的信息,但从语义理解的角度来看,有时只看前边时间步的信息是不够的。我们来看下边的例子。南京市 长江 大桥 是 一个 工程 奇迹。 南京 市长 江大桥 是…

2026/9/24 17:27:30 阅读更多 →
Linux 下 Redis Cluster 安装与部署

Linux 下 Redis Cluster 安装与部署

Linux 下 Redis Cluster 安装与部署 一、环境信息系统主机密码内存端口CentOS-7192.168.4.81jxbd816G主:7001,备:7002CentOS-7192.168.4.82jxbd826G主:7001,备:7002CentOS-7192.168.4.85jxbd856G主&#xf…

2026/9/24 17:27:30 阅读更多 →
安科瑞助力新型电力负荷管理系统建设:政策驱动下的企业微电网智慧升级方案

安科瑞助力新型电力负荷管理系统建设:政策驱动下的企业微电网智慧升级方案

随着国家能源局明确鼓励工业企业、工业园区建设智能微电网,新型电力负荷管理系统成为电力保供与新能源消纳的关键抓手。江苏省率先出台《新型电力负荷管理系统数据接入规范》,为虚拟电厂、智能微电网等新型经营主体的数据接入与协同运营提供了技术遵循。…

2026/9/24 17:26:29 阅读更多 →

日新闻

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为…

2026/9/24 0:00:19 阅读更多 →
单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

简介:一份基于单细胞RNA测序数据的细胞类型注释算法研究Python毕业设计源码,针对计算机相关专业正在做毕设或需要项目实战的学习者,可用于课程设计与期末大作业。项目代码完整、经导师指导评审通过,可直接运行,覆盖数据…

2026/9/24 0:00:19 阅读更多 →
C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

第一次在项目里被反射卡住,是在一个老旧的WinForms模块里:几十个类依赖PropertyChanged通知,运行时反射读属性、发通知,每次启动慢半拍不说,一上.NET Native/AOT裁剪模式几乎全面崩盘。后来我把这段逻辑全部改成C#源生…

2026/9/24 0:00:19 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/24 14:34:13 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/24 9:10:42 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/24 14:33:56 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/24 12:50:34 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/24 14:33:48 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/24 12:49:17 阅读更多 →