DeepSeek V4-Flash正式版更新:模型名、Agent基准与迁移指南

DeepSeek 在 2026 年 7 月 31 日的更新日志中宣布,DeepSeek-V4-Flash 正式版 API 开放公测。对已经接入 V4-Flash Preview 的开发者来说,这次更新最容易被误读成“换一个模型名就结束了”;对还在使用旧版 deepseek-chat 和 deepseek-reasoner 的项目来说,真正需要关注的是模型别名、思考模式、工具调用和回归测试。
本文只讨论官方 API 更新,不延伸到 App 或网页端体验。你将看到四件事:正式版到底改变了什么,官方公布的 Agent 分数应该怎样读,哪些兼容性需要重新验证,以及一套可以在生产项目中执行的迁移清单。
一、先确认这次更新的范围
截至 2026-07-31,DeepSeek 官方更新日志给出的关键信息是:
- 正式版 API 模型名为
deepseek-v4-flash; - API 调用方式不变,已经使用兼容接口的客户端可以从模型参数开始迁移;
- 正式版 V4-Flash 使用 DeepSeek Harness 极简模式参与公开 Code Agent 基准测试;
- V4-Flash-0731 的模型结构、尺寸与 V4-Flash-Preview 保持一致,但重新进行了后训练;
- 本次只升级 V4-Flash API,V4-Pro API 以及 App、Web 端模型没有同步更改;
- 官方说明 V4-Pro 正式版会在后续发布,但当前不能把它当作已经支持的能力。
这里有一个重要的范围边界:模型结构和尺寸保持一致,不代表输出行为完全不变。后训练变化可能影响代码风格、工具调用决策、拒答边界、思考长度和结构化输出。真正上线前仍然要做业务回归,而不能只验证 HTTP 请求能返回 200。
二、模型名和旧别名应该怎样理解
正式版应该显式使用:
deepseek-v4-flash2026 年 4 月的官方更新曾说明,旧有的 deepseek-chat 与 deepseek-reasoner 将在 2026-07-24 停止使用,并在过渡阶段分别指向 V4-Flash 的非思考模式和思考模式。这个日期已经到达,因此新代码不应该继续依赖旧别名。
旧项目迁移时要区分两类情况:
新项目
直接把模型参数写成 deepseek-v4-flash,并在代码中明确自己使用的是思考模式还是非思考模式。这样以后检查日志、费用和问题时,不必再猜旧别名当时指向什么版本。
已有项目
先搜索仓库中所有 deepseek-chat、deepseek-reasoner、模型路由表和环境变量,再逐处确认:
rg -n "deepseek-chat|deepseek-reasoner|deepseek-v4-flash|model" .执行位置是项目根目录。预期结果是列出配置文件、服务端调用、测试夹具和文档中的旧模型名。只改一处默认配置是不够的,测试和回滚配置也可能继续使用旧别名。
三、官方 Agent 基准应该怎样读
更新日志列出了以下结果:
| 测试集 | 官方公布分数 |
|---|---|
| Terminal Bench 2.1 | 82.7 |
| NL2Repo | 54.2 |
| Cybergym | 76.7 |
| DeepSWE | 54.4 |
| Toolathlon verified | 70.3 |
| Agent Last Exam | 25.2 |
| Automation Bench (Public) | 25.1 |
| DSBench-FullStack | 68.7 |
| DSBench-Hard | 59.6 |
这些数字可以说明官方测试条件下的模型表现,但不能直接变成“你的业务成功率”。至少要注意三点。
第一,官方注明公开基准中的 Code Agent 任务使用 DeepSeek Harness 极简模式,并使用 max 档位、top_p=0.95、temperature=1.0。如果你的系统使用不同的 Harness、不同推理强度、不同工具描述和不同上下文,结果不能直接对齐。
第二,DSBench-FullStack 和 DSBench-Hard 是内部使用的测试集。读者可以把它们作为官方披露的参考信息,但无法像公开数据集那样独立复现全部样本和评测流程。
第三,Agent 基准通常同时受到模型、工具、提示词、运行环境、重试策略和验收器影响。一次任务的最终成功,不一定全部来自模型本身。因此,选型时要记录完整实验条件,而不是只保存一个分数。
四、接口层面真正值得关注的变化
官方模型价格页目前列出 V4-Flash 的接口能力包括:
- OpenAI 格式接口;
- Anthropic 格式接口;
- Responses API;
- JSON Output;
- Tool Calls;
- 思考与非思考模式;
- 对话前缀续写和 FIM 补全等能力。
其中 Responses API 当前只支持 deepseek-v4-flash,不支持 deepseek-v4-pro。这使 Flash 成为当前官方 Codex 接入文档中指定的模型,但也意味着你不能把所有 OpenAI Responses 客户端参数都假设为可用。
根据官方 Responses API 兼容性说明,以下边界值得在迁移测试中单独检查:
previous_response_id和conversation不支持,接口是无状态的;- 图片和文件输入不支持;
- function、web_search 工具支持,其他内置工具可能被忽略;
- Codex 兼容需要的
custom工具目前只支持apply_patch; parallel_tool_calls会被忽略,服务端始终开启并行工具调用;- 输入超过上下文窗口会返回 400,而不是自动截断;
- 不支持的参数可能被静默忽略,不能只根据请求没有报错判断参数生效。
五、迁移时不要只验证模型名
建议用真实业务样本建立一份迁移回归表:
| 检查项 | 验证内容 | 通过条件 |
|---|---|---|
| 模型路由 | 所有调用是否指向 deepseek-v4-flash | 日志和请求体一致 |
| 基础回答 | 典型问答、长文和中文输出 | 通过业务质量阈值 |
| 思考模式 | 开关、effort、reasoning_content | 参数生效且解析正常 |
| 工具调用 | 工具选择、参数 JSON、连续多轮 | 工具结果能继续回传 |
| 结构化输出 | JSON schema 或解析逻辑 | 输出可被程序消费 |
| 流式输出 | SSE 事件和结束事件 | 客户端能正常收口 |
| 长上下文 | 接近业务上限的输入 | 不出现意外 400 或截断 |
| 失败重试 | 429、超时、5xx 和不完整输出 | 重试不产生重复副作用 |
| 成本记录 | 输入、缓存、输出 Token | 能按项目归因 |
如果系统有自动路由,建议给正式版增加独立的模型标识和指标维度。不要把 Preview 和正式版写进同一个模糊的“V4 Flash”标签,否则后续无法判断一次回归失败究竟来自模型更新还是业务代码变化。
六、哪些结论现在不能直接下
下面这些说法不能仅凭更新日志得出:
- 正式版在所有业务中都比 Preview 好;
- 官方基准分数等于你的 Agent 成功率;
- API 调用方式不变就代表所有 SDK 参数都不需要测试;
- Flash 一定适合所有长文本、多模态和复杂工具场景;
- V4-Pro 的未来支持情况可以用于今天的生产架构决策。
更准确的写法是:官方已经公开了模型名、接口入口和一组测试结果;企业或个人开发者仍需在自己的提示词、工具、数据和验收器条件下做回归。
七、一个可回滚的迁移流程
第一步,保留旧路由配置,新增 deepseek-v4-flash 作为可选模型,不要直接覆盖生产默认值。
第二步,选取一组脱敏的固定样本,保存旧模型输出、工具轨迹、Token 用量和错误日志。
第三步,只切换模型名,先不同时修改提示词、工具 schema、解析器和重试策略。一次只改一个变量,才能定位差异来源。
第四步,对比回答质量、工具成功率、结构化输出解析率、延迟和失败类型。指标未达标时,保留原始响应和完整请求参数用于排查。
第五步,灰度流量,按业务用户或内部项目逐步扩大范围。涉及写数据库、发消息、下单或修改代码的 Agent,要先使用模拟工具或审批模式。
第六步,确认旧路由的回滚开关仍然有效,再考虑把正式版设为默认。回滚不仅要改模型参数,还要确认 reasoning_content、Responses 事件和工具调用状态的解析逻辑兼容。
结语
DeepSeek-V4-Flash 正式版的核心信息可以概括为三点:模型名明确为 deepseek-v4-flash,API 接入方式保持连续,后训练和 Agent 能力测试发生了变化。模型结构与 Preview 保持一致,不能被理解为输出行为完全不变。
对新项目,直接按正式模型名和当前官方接口文档开发;对旧项目,优先完成别名清理、思考模式检查、工具调用回归和可回滚灰度。官方基准适合帮助你了解更新方向,真正的上线结论仍然要由自己的测试样本和验收规则给出。
Related
相关文章推荐

Agent上线后怎么观测?三仪表盘监控成功率/接管率/成本
Agent上线后三仪表盘:任务成功率、人工接管率与成本监控,事件链设计与异常排查流程。

MT-SDPO多教师蒸馏实战:多模型集成降本与路由策略
多教师蒸馏MT-SDPO实战:按样本选教师、验证器把门、缓存降本,附4sapi多模型路由示例。

21万页假评测污染 AI 推荐|引用溯源避坑
内容农场如何污染AI推荐?来源校验、模板检测、去重与引用溯源,附4sapi接入示例。

电商Agent架构拆解:单Agent+技能工具 vs 多子智能体取舍
电商Agent单Agent+技能/工具架构实战,对比多子智能体取舍,附4sapi接入Python示例。