近期AI热点006|DeepSeek V4-Flash-0731 更新:Agent 跑分大涨,API 接入有哪些变化
近期AI热点006DeepSeek V4-Flash-0731 更新Agent 跑分大涨API 接入有哪些变化主要信息源DeepSeek API 官方更新日志、DeepSeek V4 官方发布页、模型与定价文档、Responses API 文档关键词DeepSeek V4、DeepSeek-V4-Flash-0731、AI Agent、Responses API、Codex、上下文缓存、API 迁移2026 年 7 月 31 日DeepSeek 将DeepSeek-V4-Flash正式版 API 开放公测。调用时仍然使用原来的模型名deepseek-v4-flash但该别名目前已经指向DeepSeek-V4-Flash-0731。这次更新最容易产生的误解是把它写成“DeepSeek V4 正式版全面发布”。官方更新日志给出的范围更窄只升级了DeepSeek-V4-FlashAPI。DeepSeek-V4-ProAPI 没有随本次更新改变。DeepSeek App 和网页端模型没有随本次更新改变。V4-Flash-0731 与 Flash Preview 的架构和模型规模相同变化来自重新后训练。DeepSeek-V4-Pro 正式版仍被描述为“即将发布”官方没有在日志中给出确切日期。因此更准确的说法是DeepSeek V4 系列完成了一次面向 Agent 与代码工作流的 Flash API 更新而不是整个 V4 家族同时换代。先把 V4、Flash 和 0731 的关系理顺DeepSeek V4 Preview 最初于 2026 年 4 月 24 日发布。官方当时给出的两个版本分别是项目DeepSeek-V4-FlashDeepSeek-V4-Pro总参数量284B1.6T每 Token 激活参数量13B49BAPI 模型名deepseek-v4-flashdeepseek-v4-pro上下文长度1M Token1M Token最大输出最高 384K Token最高 384K TokenResponses API支持暂不支持官方称 2026 年 8 月上旬加入7 月 31 日更新状态已升级至 V4-Flash-0731本次未更新Flash 并不是 Pro 的简单量化版本。两者总参数量与激活参数量不同面向的成本和吞吐目标也不同。V4-Flash 的 284B 总参数、13B 激活参数设计更适合高并发 API 和代码 AgentV4-Pro 则把更多模型容量留给复杂推理与高难度知识任务。V4 在结构上使用 Token-wise Compression 与 DeepSeek Sparse AttentionDSA目标是降低长上下文的计算和内存压力。官方把 1M Token 作为 V4 服务的标准上下文长度但“窗口能装下 1M”不等于每个任务都应该塞满 1M。长输入仍然会增加首 Token 延迟、缓存依赖和失败重试成本。这次不是扩模型而是重新后训练官方明确说明V4-Flash-0731 保持了 Preview 的架构和规模仅进行了重新后训练。这句话很关键。Agent 能力并不只由预训练阶段的知识量决定还依赖模型在后训练中学会怎样将一个长任务拆成可执行步骤。根据工具返回值修正计划。在多个文件和多轮工具调用之间保持任务状态。发现测试失败后继续定位根因而不是换一种措辞宣布完成。生成符合工具 Schema 的参数并处理异常、超时和空结果。同一个底座经过不同的 Agent 轨迹、工具调用数据和强化学习训练表现可能发生明显变化。这也是为什么 V4-Flash-0731 可以在不改变参数规模的情况下把主要升级点放在代码 Agent、终端操作和自动化任务上。官方 Agent 跑分提升了多少DeepSeek 公布了 V4-Flash-0731 的九项 Agent 相关结果评测官方成绩主要方向Terminal Bench 2.182.7终端环境中的多步任务NL2Repo54.2从自然语言需求生成或修改代码仓库CyberGym76.7网络安全环境任务DeepSWE54.4软件工程 AgentToolathlon Verified70.3多工具调用Agent Last Exam25.2综合 Agent 难题Automation BenchPublic25.1业务自动化DSBench-FullStack68.7全栈开发DeepSeek 内部集DSBench-Hard59.6高难度代码 AgentDeepSeek 内部集官方称这些结果“远超 V4-Pro-Preview”但更新日志没有在同一张表中列出 Pro Preview 的逐项分数因此不能从公告直接计算每项提升百分比。评测条件也需要一起阅读。公开代码 Agent 测试使用尚未发布的DeepSeek Harnessminimal 模式推理强度为 maxtop_p0.95、temperature1.0DSBench-FullStack 和 DSBench-Hard 则是内部测试集。这带来三个限制Harness 尚未发布时第三方无法完整复现官方运行方式。内部测试集缺少公开样本和独立提交结果适合观察方向不适合直接用于跨厂商排名。max effort 的成绩不能代表默认设置下的延迟、Token 消耗和单位任务成本。对开发团队来说更可靠的验证方法是准备自己的 20100 个真实任务固定代码仓库版本、Prompt、工具权限、超时和最大尝试次数同时记录一次成功率、平均 Token、测试通过率和人工返工时间。Responses API 是本次更新的工程重点V4-Flash-0731 原生支持 Responses API并针对 Codex 做了适配。使用 OpenAI Python SDK 时最小调用方式如下python-m venv.venv.venv\Scripts\Activate.ps1 python-m pip install--upgrade openai$env:DEEPSEEK_API_KEY你的 API KeyimportosfromopenaiimportOpenAI clientOpenAI(api_keyos.environ[DEEPSEEK_API_KEY],base_urlhttps://api.deepseek.com,)responseclient.responses.create(modeldeepseek-v4-flash,instructions(你是代码分析助手。先定位根因和现有测试没有获得可复核证据时不要声称任务已经完成。),input检查任务队列为什么会重复消费并给出最小修改方案。,max_output_tokens4096,)print(response.output_text)print(response.usage)模型名不需要添加-0731。继续使用deepseek-v4-flash服务端就会路由到当前最新版本。这个方式便于无缝更新但也意味着生产系统不能只记录模型别名日志中最好同时保存请求时间、返回的实际模型版本和回归测试结果否则同一份代码在不同日期可能得到不同表现。“兼容 Responses API”不等于完整实现所有能力DeepSeek 官方兼容性表列出了几项容易踩坑的差异API 当前是无状态的不支持previous_response_id和conversation。store固定为false不提供服务端响应状态存储。支持函数工具和服务端网页搜索Codex 兼容的自定义工具只支持名为apply_patch的类型。file_search、code_interpreter、computer_use、mcp等内置工具会被忽略。max_tool_calls会被忽略应用必须自己限制工具调用次数。图片和文件输入尚不支持传入后不会正常提供视觉或文件内容。超过上下文窗口不会自动截断而是返回 400 错误。部分不支持的参数会被静默忽略而不是直接报错。最后一项尤其需要注意。请求成功只能说明接口接受了参数不代表每个字段都生效。迁移现有 Responses API 客户端时应根据官方兼容表逐项检查而不是把“HTTP 200”当作兼容性测试完成。流式响应也没有data: [DONE]结束标记。客户端应根据response.completed、response.incomplete或response.failed判断结束状态并分别处理文本增量、推理内容、函数参数和最终 Usage。旧模型名已经到迁移节点V4 Preview 发布时DeepSeek 宣布旧的deepseek-chat和deepseek-reasoner将在 2026 年 7 月 24 日 15:59UTC后退役。过渡期内它们分别指向 V4-Flash 的非思考与思考模式。现在已经超过官方给出的退役时间。新项目应直接使用deepseek-v4-flash deepseek-v4-pro迁移时不要只做字符串替换还要检查思考模式、最大输出、工具调用历史和错误处理。V4 同一模型支持思考与非思考模式官方当前将思考模式列为默认模式如果旧业务依赖deepseek-chat的短响应与较低 Token 消耗应显式验证新默认行为。价格很低但缓存命中率会放大差距官方价格页当前列出的单价如下单位均为每 100 万 Token计费项V4-FlashV4-Pro输入缓存命中0.0028 美元0.003625 美元输入缓存未命中0.14 美元0.435 美元输出0.28 美元0.87 美元并发上限2500500V4-Flash 的缓存命中输入价格只有未命中的 1/50。对于代码仓库、固定系统提示词和长工具定义稳定前缀比反复压缩几百个 Token 更值得优化。假设一次 Agent 任务使用 20 万输入 Token 和 2 万输出 Token情况计算估算费用输入全部未命中缓存0.2 × $0.14 0.02 × $0.280.0336 美元输入全部命中缓存0.2 × $0.0028 0.02 × $0.280.00616 美元真实任务通常是部分命中且工具返回内容、失败重试和推理 Token 都会改变费用。生产环境应记录input_tokens_details.cached_tokens和output_tokens_details.reasoning_tokens计算“每个成功任务成本”而不只是每次请求成本。价格页还预告了峰谷定价每天北京时间 9:0012:00、14:0018:00 的所有计费项将按常规价格的 2 倍计费。但截至本次核对官方尚未公布生效日期因此不能把双倍价格写成已经实施。批处理系统可以提前预留调度开关等官方确认生效后再避开峰值时段。API 更新与新权重发布要分开看4 月 24 日的 V4 Preview 公告提供了技术报告和开放权重集合。7 月 31 日的更新日志则明确讨论DeepSeek-V4-FlashAPI 公测并称 0731 版本保持原架构和规模、仅重新后训练。官方这次没有在更新日志中宣布新的 V4-Flash-0731 权重包。因此可以确认的是线上 API 已升级不能仅凭这份公告推导 0731 后训练权重已经同步开放。需要自托管的团队应以 DeepSeek 官方 Hugging Face 仓库中的具体模型卡、提交时间和许可证为准。升级前可以做一轮小型回归如果现有服务已经调用deepseek-v4-flash代码可能不需要修改但行为已经可能发生变化。上线前建议至少检查选取真实的代码修改、终端任务和工具调用轨迹建立固定测试集。分别测试思考与非思考模式并记录 Token 和延迟。验证 JSON Schema、函数参数和多轮工具结果能否稳定回传。在应用层限制工具次数、总耗时、写入路径和外部副作用。测试超长输入、工具失败、流式中断和 400/429/5xx 的处理。记录实际版本与请求时间避免模型别名自动更新后无法定位回归。V4-Flash-0731 的看点不是参数又变大了而是 DeepSeek 试图用同一底座的后训练升级换取更强的 Agent 执行能力并通过 Responses API 进入现有代码代理工作流。接下来更值得关注的是 DeepSeek Harness 能否按承诺开放、公开测试能否复现官方成绩、V4-Pro 正式版何时发布以及 0731 后训练权重是否会同步提供。对开发者而言在这些信息落地以前最有价值的动作仍然是用自己的任务集做回归而不是只根据一张跑分表决定全量迁移。参考资料DeepSeek APIChange LogDeepSeek-V4-Flash Update2026-07-31https://api-docs.deepseek.com/updatesDeepSeek APIDeepSeek V4 Preview Release2026-04-24https://api-docs.deepseek.com/news/news260424DeepSeek APIModels Pricinghttps://api-docs.deepseek.com/quick_start/pricingDeepSeek APIYour First API Callhttps://api-docs.deepseek.com/DeepSeek APIUsing the Responses APIhttps://api-docs.deepseek.com/guides/responses_apiDeepSeek APIThinking Modehttps://api-docs.deepseek.com/guides/thinking_modeDeepSeekV4 官方开放权重集合https://huggingface.co/collections/deepseek-ai/deepseek-v4

相关新闻

元器件库与PCB封装库关联介绍

元器件库与PCB封装库关联介绍

【OrCAD Capture】元器件库与PCB封装库关联介绍 前言 在使用OrCAD Capture进行原理图设计时,元器件符号与PCB封装之间的正确关联是整个设计流程中最关键的环节之一。关联是否正确,直接决定了后续网表能否顺利导入Allegro PCB Editor进行布局布线。本文将…

2026/8/10 11:40:38 阅读更多 →
新手入门 OpenClaw 完整操作手册,从下载到指令实操全流程(含安装包)

新手入门 OpenClaw 完整操作手册,从下载到指令实操全流程(含安装包)

OpenClaw 一键安装包|一键部署,告别复杂环境配置 适配系统:Windows10/11 64 位、macOS 12 及以上 当前版本:Windows v2.9.3、macOS v2.7.9 压缩包体积:45.8MB 核心优势 整套流程可视化交互,全程不用调用…

2026/8/10 11:40:38 阅读更多 →
嵌入式处理器仿真技术——gem5原理与实战

嵌入式处理器仿真技术——gem5原理与实战

1. 引言 在嵌入式系统开发、计算机体系结构研究和芯片设计验证领域,处理器仿真技术扮演着至关重要的角色。它允许开发者在硬件实际生产之前,就对软件、操作系统乃至整个系统的性能、功耗和功能进行全面的评估与验证,从而大幅降低研发成本、缩…

2026/8/10 11:40:38 阅读更多 →

最新新闻

从离散Token到稠密向量:Embedding核心原理与工程实践全解析

从离散Token到稠密向量:Embedding核心原理与工程实践全解析

1. 项目概述:从离散符号到连续空间的桥梁在自然语言处理(NLP)和现代机器学习领域,我们常常会遇到一个看似简单却至关重要的任务:如何让计算机理解“苹果”这个词?对于人类来说,“苹果”可以联想…

2026/8/11 1:30:42 阅读更多 →
如何免费让Windows资源管理器拥有毛玻璃效果:ExplorerBlurMica终极美化指南

如何免费让Windows资源管理器拥有毛玻璃效果:ExplorerBlurMica终极美化指南

如何免费让Windows资源管理器拥有毛玻璃效果:ExplorerBlurMica终极美化指南 【免费下载链接】ExplorerBlurMica Add background Blur effect or Acrylic (Mica for win11) effect to explorer for win10 and win11 项目地址: https://gitcode.com/gh_mirrors/ex/E…

2026/8/11 1:30:42 阅读更多 →
从 0 到 1 打造端到端 AI 销售智能体:Spring Boot 4 + Spring AI 2.0 全栈实战复盘(含登录统计曲线图、HTTPS 上线)

从 0 到 1 打造端到端 AI 销售智能体:Spring Boot 4 + Spring AI 2.0 全栈实战复盘(含登录统计曲线图、HTTPS 上线)

一个"AI 智能获客助手"的真实落地过程:潜客挖掘 → 个性化触达 → 转化 → 数据复盘的全链路自动化,以及踩过的坑、做过的取舍。 一、为什么要做这件事 做 B2B 销售的朋友都有体会:获客难、触达累、转化靠玄学。 潜客数据要手动去…

2026/8/11 1:30:42 阅读更多 →
现代网络安全防护体系:从三位一体到实战策略

现代网络安全防护体系:从三位一体到实战策略

1. 网络安全新形势:从防病毒到三位一体防护十年前提起网络安全,大多数人第一反应就是"装个杀毒软件"。但如今网络安全早已不是简单的病毒查杀,而是演变为覆盖保密性、完整性和可用性的三位一体防护体系。我从事企业安全建设八年&am…

2026/8/11 1:30:42 阅读更多 →
嵌入式 Linux 巡检开发短记:启动链路怎么核对

嵌入式 Linux 巡检开发短记:启动链路怎么核对

嵌入式 Linux 巡检开发短记:启动链路怎么核对 嵌入式 Linux 的巡检不应照搬服务器清单。重点是启动链路、存储寿命、时间同步和业务进程是否仍处在预期状态。 每次启动都能自证 采集内核版本、设备树标识、根文件系统挂载方式、启动槽位和应用版本,并把它…

2026/8/11 1:30:41 阅读更多 →
Vue3 还原一个企业级后台-02-技术选型

Vue3 还原一个企业级后台-02-技术选型

技术选型:Vue3 vs React,为什么选 Element Plus 技术选型不是"我喜欢什么就用什么",而是"在当前场景下,什么组合能让开发效率最高、维护成本最低、读者最容易跟上"。 一、选型为什么重要 在动手写第一行代码…

2026/8/11 1:29:41 阅读更多 →

日新闻

如何用Video2X实现专业级视频画质提升:AI视频增强完整指南

如何用Video2X实现专业级视频画质提升:AI视频增强完整指南

如何用Video2X实现专业级视频画质提升:AI视频增强完整指南 【免费下载链接】video2x A machine learning-based video super resolution and frame interpolation framework. Est. Hack the Valley II, 2018. 项目地址: https://gitcode.com/GitHub_Trending/vi/v…

2026/8/11 0:00:02 阅读更多 →
前后端分离项目中控制台与接口工具数据差异排查指南

前后端分离项目中控制台与接口工具数据差异排查指南

1. 问题现象解析:控制台与Apifox的数据差异 最近在调试一个前后端分离项目时,遇到了一个典型问题:后端服务在本地开发环境控制台能正常输出查询数据,但通过Apifox测试时却返回空结果。这种"控制台有数据,接口工具…

2026/8/11 0:00:03 阅读更多 →
AI编程实战:从Claude Code踩坑到游戏开发入门

AI编程实战:从Claude Code踩坑到游戏开发入门

1. 从“AI能帮我做游戏”到“AI让我重新学编程”最近身边不少朋友,尤其是一些非技术背景、但对游戏开发有浓厚兴趣的朋友,都在问我同一个问题:“听说现在用Claude Code这种AI编程工具,小白也能做游戏了,是真的吗&#…

2026/8/11 0:00:03 阅读更多 →

周新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码(维护中 rm repo) 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/11 1:08:05 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/11 1:08:05 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身,而应重视模型外的系统搭建,即Harness。提出AgentModelHarness的实用公式,详细介绍Harness的四个层次:持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/11 1:08:05 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/10 17:07:33 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/11 1:08:06 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/10 17:07:33 阅读更多 →