Flash 免费、Pro 更强、旧模型退役DeepSeek 这套「弃车保帅」组合拳你看懂了吗【免费下载链接】DeepSeek-V4-Flash-0731项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-V4-Flash-07312026 年 4 月 24 日DeepSeek 正式发布 V4 系列把延续了两代的「对话模型 推理模型」双轨制一刀切掉换成Pro 与 Flash两条新线三个月后的 7 月 24 日服役多年的deepseek-chat与deepseek-reasoner走到生命终点又过了一周7 月 31 日DeepSeek-V4-Flash-0731 正式版 API 上线Agent 与编程能力全面反超自家 Pro 预览版而 Pro 正式版的服务反而一拖再拖、直至面临下线。表面看这是三条各自独立的产品公告串起来却是一盘逻辑自洽的棋让 Flash 扛起规模化流量让 Pro 退守高价值战场让旧模型体面退役。本文以社区情报为线索、以本仓库开源权重为证据拆解这套「弃车保帅」组合拳的每一步棋。一、退役时间线一场有预谋的「产品归一」先还原完整时间线2026-04-24V4 预览版发布同步更新 API 定价体系。官方明确旧接口模型名deepseek-chat对应 V4 Flash非思考模式、deepseek-reasoner对应 V4 Flash思考模式并预告旧名称「未来将逐步弃用」2026-07-24deepseek-chat与deepseek-reasoner正式退役社区在接入教程中反复提示「旧名停用时间点7月24日」大量 Claude Code、Codex、cc-switch 配置需要在这之前完成迁移2026-07-31DeepSeek-V4-Flash-0731 正式版发布原生支持 Responses API 并针对性适配 Codex但只升级了 Flash 的 API网页端、App 端与 V4-Pro 均未同步更新后续V4-Pro 预览版 API 服务多次延期最终对外宣布推迟到 9 月 14 日下线。把这条时间轴和仓库对应起来看会发现一个关键事实本仓库的发布版本号是DeepSeek-V4-Flash-0731正是 7 月 31 日那天上线的正式版权重——旧模型退役与新模型转正之间只隔了一周DeepSeek 几乎没有给用户留「并行维护两代模型」的过渡期。为什么敢这么干因为在产品定位上新模型已经完成了对旧模型的完全覆盖。V4 用统一的 Thinking Mode 取代了「对话/推理」二分法同一个 Flash 模型thinking_mode切到 chat 就是快答切到 thinking 就是深度推理。deepseek-chat和deepseek-reasoner当年靠两个端点区分的能力如今收敛进了同一个模型的两个开关里。旧模型的使命——验证两条技术路线的市场反馈——已经完成继续维护就是纯成本。二、Pro 的退场不是变弱是让出生态位看起来最反常的是 Pro标题说「Pro 更强」可 Pro 预览版却在 Flash 正式版发布后节节败退——Agent 基准被 Flash 正式版全面碾压正式版一再跳票服务甚至推迟下线。这难道是 Pro 不行了恰恰相反这是典型的资源再分配。看 README.md 里的官方基准表对比的是三个对象BenchmarkV4-Flash-0731V4-Flash (Preview)V4-Pro (Preview)Terminal Bench 2.182.761.872.1NL2Repo54.239.438.5Cybergym76.738.752.7DeepSWE54.47.312.8Toolathlon-Verified70.349.755.9Agents Last Exam25.215.816.5DSBench-Hard59.625.831.1注意最后一列被碾压的不是正式版 Pro而是 Pro 预览版。V4-Flash-0731 与 V4-Flash Preview 的结构、参数量完全一致全部增益来自「后训练阶段针对 Agent 能力的大幅优化」——这在 README.md 里写得很清楚「has the same model structure as DeepSeek-V4-Flash-DSpark」升级点集中在后训练而非架构重做。于是 Pro 预览版的处境就变得尴尬了它在 2026 年 4 月发布时是「更强的那个」但三个月的后训练竞赛之后一个参数量更小的 Flash 正式版在 Agent 任务上全线超过它。对 DeepSeek 而言与其继续为 Pro 预览版烧推理资源不如把训练算力集中到 Pro 正式版上打磨让预览版按计划下线。Pro 不是被淘汰而是退场重练——这套棋里它要做的是让出「占位」生态位把成本敏感型流量让给 Flash自己未来只承接复杂推理与高精度任务。更深一层是商业逻辑Pro 预览版输入 12 元/百万 Token、输出 24 元是 Flash 的 10 倍以上。若 Pro 预览版长期在线用户会天然流向更贵的模型而把 Pro 下线、只保留 Flash 与未来更强的新 Pro等于强制做了一次「需求分层」——能用便宜模型解决的任务没有理由让用户花十倍的价钱。所谓弃车保帅弃的是预览版这张「车」保的是定价体系这张「帅」。三、Flash 接棒一张定价表背后的成本革命如果说前两步是「减法」那么 Flash 接棒就是「加法」——把规模红利与定价权一次性押在最低价模型上。看发布时的定价表V4 Flash输入缓存命中约 0.2 元/百万 Token输入未命中约 1 元输出约 2 元V4 Pro输入缓存命中约 1 元输入未命中约 12 元输出约 24 元。随后 DeepSeek 两天内连续两次降价输入输出在 2.5 折的基础上缓存命中输入再打 1 折且官方确认缓存折扣永久有效。量子位的实测数据显示在 Agent 编程任务中输入 Token 占比远高于输出V4-Pro 输入缓存命中率约 95%、V4-Flash 约 91%——大部分费用都按「命中缓存的输入」结算。实测下来同等产出整体成本骤降约 83%3500 万 Token 的消耗从 31.73 元降到 5.34 元。社区那句「Flash 才是杀手锏」的判断本质上是能力—成本帕累托边界的位移大多数日常任务根本用不到模型顶部的那一点点智能差距Flash 完全够用。「免费」的说法也正是从这个语境里长出来的——对开发者而言Flash 的单价已经低到可以当免费额度用对 DeepSeek 而言Flash 是那个负责「扩量」的入口级产品先让流量进来再谈生态。四、低价的底气从仓库源码看 Flash 为什么能这么便宜Flash 敢卖 1 元/百万 Token靠的不是贴钱而是架构本身就为低成本推理而生。翻本仓库的 config.json几个数字值得注意max_position_embeddings: 1048576—— 百万级上下文与宣传口径一致num_hidden_layers: 43、n_routed_experts: 256、num_experts_per_tok: 6—— DeepSeekMoE 架构43 层里 256 个专家路由每 Token 只激活 6 个专家稀疏激活是成本神话的第一支柱expert_dtype: fp4加quantization_config中的 FP8e4m3量化——专家权重压到 FP4、激活用 FP8显存与带宽需求大幅下探这是本地部署与低价 API 的物理基础dspark_block_size: 5、dspark_target_layer_ids: [40, 41, 42]、dspark_markov_rank: 256—— 内嵌 DSpark 投机解码模块README 明确该结构与 DeepSeek-V4-Flash-DSpark 一致用草稿模型加速验证vLLM 里一个--speculative-config {method:dspark,num_speculative_tokens:7,...}就能开启。model.safetensors.index.json里记录的total_size约 166.9 GBBF16 全量配合 FP4 专家权重的实际落地部署一台 60GB 内存的桌面机就能跑——微软在社区讨论中甚至称其「在部分编程任务上表现优于 GPT-5」单台 DGX 即可承载推理服务。稀疏激活 低位量化 投机解码这三板斧直接压低了单 Token 的边际成本让 1 元/百万 Token 的定价有真实的成本结构支撑而不是亏本赚吆喝。五、生态位的最终形态便宜、能干、好接入回到 0731 正式版这次更新还补齐了「好接入」这一环原生支持 Responses API针对 Codex 做了适配价格一分未涨。此前把 V4-Flash 接进 Codex 需要经代理把 Chat Completions 转成 Responses 格式多一层适配就多一分工具调用与流式输出的兼容性风险原生支持后deepseek-v4-flash直接成为 Codex/Claude Code 的一等公民。而模型侧Agent 能力的关键细节都沉淀在仓库里encoding/README.md 与 encoding/encoding_dsv4.py 完整实现了 OpenAI 兼容消息到模型输入的编码——工具调用走 DSML 格式、思考块用think.../think分隔、reasoning_effort三档low/high/max以纯文本前缀实现其中max档是官方推荐的 Agent 评测配置README 中注明 Code Agent 评测使用max档、temperature1.0、top_p0.95。这套编码层让第三方 Agent 框架无需改动即可获得工具调用与深度思考能力正是 0731 在 Cybergym38.7→76.7、DeepSWE7.3→54.4上实现数倍提升的工程底座。至此DeepSeek 的组合拳全貌清晰了弃退役deepseek-chat/deepseek-reasoner砍掉维护成本与用户心智负担让Pro 预览版退场重练把「最强」的预期留给正式版同时避免高定价模型稀释低价流量保Flash 以极低价、强 Agent 能力、零改造成本接入占据规模化生态位成为新一轮价格战的旗手。这套棋最锋利的地方在于它不靠营销话术而是靠定价表与权重仓库本身形成闭环——旧模型退役、Pro 退场、Flash 接棒每一步都有基准数据、开源权重与工程代码背书。对开发者而言读懂了这套棋也就读懂了未来几个月 DeepSeek API 的选型逻辑默认上 Flash把 Pro 留给真正值得的场景。【免费下载链接】DeepSeek-V4-Flash-0731项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-V4-Flash-0731创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考