Flash 免费、Pro 更强、旧模型退役:DeepSeek 这套「弃车保帅」组合拳你看懂了吗
Flash 免费、Pro 更强、旧模型退役DeepSeek 这套「弃车保帅」组合拳你看懂了吗【免费下载链接】DeepSeek-V4-Flash-0731项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-V4-Flash-07312026 年 4 月 24 日DeepSeek 正式发布 V4 系列把延续了两代的「对话模型 推理模型」双轨制一刀切掉换成Pro 与 Flash两条新线三个月后的 7 月 24 日服役多年的deepseek-chat与deepseek-reasoner走到生命终点又过了一周7 月 31 日DeepSeek-V4-Flash-0731 正式版 API 上线Agent 与编程能力全面反超自家 Pro 预览版而 Pro 正式版的服务反而一拖再拖、直至面临下线。表面看这是三条各自独立的产品公告串起来却是一盘逻辑自洽的棋让 Flash 扛起规模化流量让 Pro 退守高价值战场让旧模型体面退役。本文以社区情报为线索、以本仓库开源权重为证据拆解这套「弃车保帅」组合拳的每一步棋。一、退役时间线一场有预谋的「产品归一」先还原完整时间线2026-04-24V4 预览版发布同步更新 API 定价体系。官方明确旧接口模型名deepseek-chat对应 V4 Flash非思考模式、deepseek-reasoner对应 V4 Flash思考模式并预告旧名称「未来将逐步弃用」2026-07-24deepseek-chat与deepseek-reasoner正式退役社区在接入教程中反复提示「旧名停用时间点7月24日」大量 Claude Code、Codex、cc-switch 配置需要在这之前完成迁移2026-07-31DeepSeek-V4-Flash-0731 正式版发布原生支持 Responses API 并针对性适配 Codex但只升级了 Flash 的 API网页端、App 端与 V4-Pro 均未同步更新后续V4-Pro 预览版 API 服务多次延期最终对外宣布推迟到 9 月 14 日下线。把这条时间轴和仓库对应起来看会发现一个关键事实本仓库的发布版本号是DeepSeek-V4-Flash-0731正是 7 月 31 日那天上线的正式版权重——旧模型退役与新模型转正之间只隔了一周DeepSeek 几乎没有给用户留「并行维护两代模型」的过渡期。为什么敢这么干因为在产品定位上新模型已经完成了对旧模型的完全覆盖。V4 用统一的 Thinking Mode 取代了「对话/推理」二分法同一个 Flash 模型thinking_mode切到 chat 就是快答切到 thinking 就是深度推理。deepseek-chat和deepseek-reasoner当年靠两个端点区分的能力如今收敛进了同一个模型的两个开关里。旧模型的使命——验证两条技术路线的市场反馈——已经完成继续维护就是纯成本。二、Pro 的退场不是变弱是让出生态位看起来最反常的是 Pro标题说「Pro 更强」可 Pro 预览版却在 Flash 正式版发布后节节败退——Agent 基准被 Flash 正式版全面碾压正式版一再跳票服务甚至推迟下线。这难道是 Pro 不行了恰恰相反这是典型的资源再分配。看 README.md 里的官方基准表对比的是三个对象BenchmarkV4-Flash-0731V4-Flash (Preview)V4-Pro (Preview)Terminal Bench 2.182.761.872.1NL2Repo54.239.438.5Cybergym76.738.752.7DeepSWE54.47.312.8Toolathlon-Verified70.349.755.9Agents Last Exam25.215.816.5DSBench-Hard59.625.831.1注意最后一列被碾压的不是正式版 Pro而是 Pro 预览版。V4-Flash-0731 与 V4-Flash Preview 的结构、参数量完全一致全部增益来自「后训练阶段针对 Agent 能力的大幅优化」——这在 README.md 里写得很清楚「has the same model structure as DeepSeek-V4-Flash-DSpark」升级点集中在后训练而非架构重做。于是 Pro 预览版的处境就变得尴尬了它在 2026 年 4 月发布时是「更强的那个」但三个月的后训练竞赛之后一个参数量更小的 Flash 正式版在 Agent 任务上全线超过它。对 DeepSeek 而言与其继续为 Pro 预览版烧推理资源不如把训练算力集中到 Pro 正式版上打磨让预览版按计划下线。Pro 不是被淘汰而是退场重练——这套棋里它要做的是让出「占位」生态位把成本敏感型流量让给 Flash自己未来只承接复杂推理与高精度任务。更深一层是商业逻辑Pro 预览版输入 12 元/百万 Token、输出 24 元是 Flash 的 10 倍以上。若 Pro 预览版长期在线用户会天然流向更贵的模型而把 Pro 下线、只保留 Flash 与未来更强的新 Pro等于强制做了一次「需求分层」——能用便宜模型解决的任务没有理由让用户花十倍的价钱。所谓弃车保帅弃的是预览版这张「车」保的是定价体系这张「帅」。三、Flash 接棒一张定价表背后的成本革命如果说前两步是「减法」那么 Flash 接棒就是「加法」——把规模红利与定价权一次性押在最低价模型上。看发布时的定价表V4 Flash输入缓存命中约 0.2 元/百万 Token输入未命中约 1 元输出约 2 元V4 Pro输入缓存命中约 1 元输入未命中约 12 元输出约 24 元。随后 DeepSeek 两天内连续两次降价输入输出在 2.5 折的基础上缓存命中输入再打 1 折且官方确认缓存折扣永久有效。量子位的实测数据显示在 Agent 编程任务中输入 Token 占比远高于输出V4-Pro 输入缓存命中率约 95%、V4-Flash 约 91%——大部分费用都按「命中缓存的输入」结算。实测下来同等产出整体成本骤降约 83%3500 万 Token 的消耗从 31.73 元降到 5.34 元。社区那句「Flash 才是杀手锏」的判断本质上是能力—成本帕累托边界的位移大多数日常任务根本用不到模型顶部的那一点点智能差距Flash 完全够用。「免费」的说法也正是从这个语境里长出来的——对开发者而言Flash 的单价已经低到可以当免费额度用对 DeepSeek 而言Flash 是那个负责「扩量」的入口级产品先让流量进来再谈生态。四、低价的底气从仓库源码看 Flash 为什么能这么便宜Flash 敢卖 1 元/百万 Token靠的不是贴钱而是架构本身就为低成本推理而生。翻本仓库的 config.json几个数字值得注意max_position_embeddings: 1048576—— 百万级上下文与宣传口径一致num_hidden_layers: 43、n_routed_experts: 256、num_experts_per_tok: 6—— DeepSeekMoE 架构43 层里 256 个专家路由每 Token 只激活 6 个专家稀疏激活是成本神话的第一支柱expert_dtype: fp4加quantization_config中的 FP8e4m3量化——专家权重压到 FP4、激活用 FP8显存与带宽需求大幅下探这是本地部署与低价 API 的物理基础dspark_block_size: 5、dspark_target_layer_ids: [40, 41, 42]、dspark_markov_rank: 256—— 内嵌 DSpark 投机解码模块README 明确该结构与 DeepSeek-V4-Flash-DSpark 一致用草稿模型加速验证vLLM 里一个--speculative-config {method:dspark,num_speculative_tokens:7,...}就能开启。model.safetensors.index.json里记录的total_size约 166.9 GBBF16 全量配合 FP4 专家权重的实际落地部署一台 60GB 内存的桌面机就能跑——微软在社区讨论中甚至称其「在部分编程任务上表现优于 GPT-5」单台 DGX 即可承载推理服务。稀疏激活 低位量化 投机解码这三板斧直接压低了单 Token 的边际成本让 1 元/百万 Token 的定价有真实的成本结构支撑而不是亏本赚吆喝。五、生态位的最终形态便宜、能干、好接入回到 0731 正式版这次更新还补齐了「好接入」这一环原生支持 Responses API针对 Codex 做了适配价格一分未涨。此前把 V4-Flash 接进 Codex 需要经代理把 Chat Completions 转成 Responses 格式多一层适配就多一分工具调用与流式输出的兼容性风险原生支持后deepseek-v4-flash直接成为 Codex/Claude Code 的一等公民。而模型侧Agent 能力的关键细节都沉淀在仓库里encoding/README.md 与 encoding/encoding_dsv4.py 完整实现了 OpenAI 兼容消息到模型输入的编码——工具调用走 DSML 格式、思考块用think.../think分隔、reasoning_effort三档low/high/max以纯文本前缀实现其中max档是官方推荐的 Agent 评测配置README 中注明 Code Agent 评测使用max档、temperature1.0、top_p0.95。这套编码层让第三方 Agent 框架无需改动即可获得工具调用与深度思考能力正是 0731 在 Cybergym38.7→76.7、DeepSWE7.3→54.4上实现数倍提升的工程底座。至此DeepSeek 的组合拳全貌清晰了弃退役deepseek-chat/deepseek-reasoner砍掉维护成本与用户心智负担让Pro 预览版退场重练把「最强」的预期留给正式版同时避免高定价模型稀释低价流量保Flash 以极低价、强 Agent 能力、零改造成本接入占据规模化生态位成为新一轮价格战的旗手。这套棋最锋利的地方在于它不靠营销话术而是靠定价表与权重仓库本身形成闭环——旧模型退役、Pro 退场、Flash 接棒每一步都有基准数据、开源权重与工程代码背书。对开发者而言读懂了这套棋也就读懂了未来几个月 DeepSeek API 的选型逻辑默认上 Flash把 Pro 留给真正值得的场景。【免费下载链接】DeepSeek-V4-Flash-0731项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-V4-Flash-0731创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

深度学习驱动的水稻病虫害自动识别:从数据到部署

深度学习驱动的水稻病虫害自动识别:从数据到部署

简介:一份基于Python机器学习的水稻病虫害自动识别系统源码与配套数据,来自答辩评审98分的个人毕业设计项目,代码经过调试测试可正常运行。系统面向计算机、通信、人工智能、自动化等相关专业的学生、老师及从业者,既适合初学者学…

2026/10/11 22:01:46 阅读更多 →
安全版小龙虾AstronClaw上手:1分钟云端部署,10000+ Skills一键接入企业微信

安全版小龙虾AstronClaw上手:1分钟云端部署,10000+ Skills一键接入企业微信

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 22:00:45 阅读更多 →
AI 编程工具—Cursor进阶使用:Codebase提示符的TaoToken统一Key配置与验证

AI 编程工具—Cursor进阶使用:Codebase提示符的TaoToken统一Key配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 22:00:45 阅读更多 →

最新新闻

新浪Level2接口SDK接入实战:授权、协议解析与避坑指南

新浪Level2接口SDK接入实战:授权、协议解析与避坑指南

简介:新浪Level2接口SDK是一份面向量化开发与行情分析人员的Java工程,用于对接新浪Level2全推行情,获取股票、基金等品种的深度交易数据。相比普通免费接口,Level2数据在速度与深度上更适合机构级策略,适合有一定Java基…

2026/10/11 22:50:35 阅读更多 →
一个 Key 调用所有模型:2026 四大聚合平台价格、生态与稳定性横评

一个 Key 调用所有模型:2026 四大聚合平台价格、生态与稳定性横评

大模型 API 聚合平台的核心价值一句话就能说清:一个 Key 接入多家大模型,统一计费与访问管理,把供应商切换成本降到最低。市面上的主流玩家分三类——国际商业聚合、国内商业聚合、自托管开源方案,路线不同,取舍也不同…

2026/10/11 22:50:35 阅读更多 →
HOP上游升级SOP:pnpm upstream:update一键同步rhwp并全链路验证的完整流程

HOP上游升级SOP:pnpm upstream:update一键同步rhwp并全链路验证的完整流程

【免费下载链接】hop 项目地址: https://gitcode.com/gh_mirrors/hop22/hop 点击查看 免费下载 HOP 是一款开源的 HWP/HWPX 文档编辑器,桌面外壳由 HOP 团队维护,而文档解析与渲染引擎来自上游项目 rhwp。如何安全地跟随上游版本前进&#x…

2026/10/11 22:50:35 阅读更多 →
Android游戏逆向重构实战:从植物大战僵尸源码2到可运行工程

Android游戏逆向重构实战:从植物大战僵尸源码2到可运行工程

简介:本资源为《植物大战僵尸》Android平台开源实现的完整工程源码,面向Android游戏开发初学者与进阶者,聚焦塔防类游戏架构设计、图形渲染与状态管理等核心实践。压缩包共173个文件,含20个Java源文件(涵盖GameScene、…

2026/10/11 22:50:35 阅读更多 →
基于线性回归的PM2.5预测系统Python源码实战解析

基于线性回归的PM2.5预测系统Python源码实战解析

简介:基于线性回归的PM2.5预测系统源码,是一套面向Python学习者、机器学习入门者及大气环境数据分析场景的小型完整项目。代码以单文件Python脚本承载数据读取、特征构造、模型训练与结果预测等关键流程,配套原始训练/测试CSV表、处理后的特征…

2026/10/11 22:50:35 阅读更多 →
PgQue 监控实战:5 个必须告警的队列健康指标 + 如何揪出卡住的消费者

PgQue 监控实战:5 个必须告警的队列健康指标 + 如何揪出卡住的消费者

【免费下载链接】PgQue PgQue – Zero-bloat Postgres queue built on top of on battle-proven Skypes PgQ. One SQL file to install, pg_cron to tick https://pgque.dev 项目地址: https://gitcode.com/gh_mirrors/pg/PgQue 点击查看 免费下载 PgQue 是一个零膨…

2026/10/11 22:49:35 阅读更多 →

日新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 10:45:37 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:53 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:54 阅读更多 →