Featured image of post DeepSeek V4 Pro-0813 已经上线,但它更像一次没有发布会的依赖升级

DeepSeek V4 Pro-0813 已经上线,但它更像一次没有发布会的依赖升级

DeepSeek 将 deepseek-v4-pro 指向 V4 Pro-0813,官方文档确认了模型版本、1M 上下文、384K 输出和当前价格,但更新日志尚未补上专门公告。对接入模型 API 的团队来说,真正要处理的是版本验证、回放测试和回滚。

8 月 13 日再看 DeepSeek 的 API 文档,deepseek-v4-pro 已经指向 DeepSeek-V4-Pro-0813

它不像一次传统意义上的模型发布。没有一篇完整的新品公告,没有一张官方 benchmark 总表,也没有把开发者引向新的 endpoint。对调用方来说,代码里的模型名仍是 deepseek-v4-pro,base URL 也不变。变化藏在模型与价格页的版本字段里。

这件事本身比“又一个模型升级了”更值得聊。

过去,模型更新像下载新软件。你会看到新版本号、更新日志和功能列表,然后决定要不要升级。现在许多模型 API 的体验更接近一个托管依赖。供应商替你维护底层实现,同一个 model ID 在某天夜里就换成了新的实际版本。方便是真方便,风险也因此从“什么时候主动升级”变成了“我怎么知道它已经变了”。

本文基于 DeepSeek 当前 API 文档、模型与价格页、官方更新日志,以及 OpenRouter 的模型记录展开。媒体和社区中关于特定 benchmark 的说法,只作为线索,不作为本文的性能结论。

官方文档已经确认了什么

DeepSeek 的首次调用 API 文档现在写得很直接:deepseek-v4-pro 对应的版本已更新为 DeepSeek-V4-Pro-0813,调用方法不变,继续使用这个稳定的 model ID 就会调用最新版本。

模型与价格页给出了当前更适合开发者确认的事实。

DeepSeek 官方 V4 模型规格图

图片来源:DeepSeek V4 Preview Release。该图介绍 V4 预览版的公开规格,用于补充 V4 系列背景,并非 V4 Pro-0813 的单独发布图。

项目 当前文档信息
稳定调用名 deepseek-v4-pro
实际版本名 DeepSeek-V4-Pro-0813
上下文长度 1M tokens
最大输出 384K tokens
接口能力 JSON Output、Tool Calls、Responses API、Anthropic API、FIM 补全等
并发限制 500
缓存命中输入 0.025 元/百万 tokens
缓存未命中输入 3 元/百万 tokens
输出 6 元/百万 tokens

页面还写明,DeepSeek 计划近期整体上调 API 定价,预计涨幅较大,具体方案以正式通知为准。这个提醒的分量不小。对长上下文、重工具调用的应用而言,模型能力变化与计费变化通常不是两件独立的事,尤其当产品开始被放进长期运行的 Agent(智能体)工作流里。

官方文档还明确列出了 Claude Code、GitHub Copilot、OpenCode 等 Agent 工具的接入入口。这里应该谨慎理解:这说明 DeepSeek 为这些工具提供了兼容或接入路径,并不等于任何一个工具都会在所有任务上获得同样的结果。工具兼容只是接入的起点,稳定性要靠真实任务验证。

为什么它看起来像“静默上线”

反差来自官方更新日志。

DeepSeek 的更新日志在 7 月 31 日发布 V4 Flash 更新时,特意注明当次更新只涉及 deepseek-v4-flash,V4 Pro API 和 App/Web 模型不变,同时称 V4 Pro 正式版将很快推出。到了这次可见的文档状态,模型与价格页已经把 deepseek-v4-pro 标为 V4 Pro-0813,但更新日志尚未新增一条专门的 V4 Pro-0813 公告。

这不能证明发布流程有什么问题。它只说明两件事发生在不同的公开页面上:可调用版本已经变化,面向外界解释版本变化的材料尚未同步补齐。

第三方平台的记录提供了相同方向的旁证。OpenRouter 的模型页面将 DeepSeek V4 Pro 0813 标为 8 月 12 日发布,并展示 1M context、384K 最大输出和由其自身收集的性能数据。它有助于确认这个版本名已经进入生态,但不应替代 DeepSeek 的官方性能声明。

DeepSeek 官方 V4 预览版基准图

图片来源:DeepSeek V4 Preview Release。该图为 V4 预览版的官方 benchmark 材料,不能用于推断 V4 Pro-0813 的具体成绩。

更稳妥的说法是:V4 Pro-0813 已经能从 DeepSeek 的官方 API 文档和第三方生态中交叉确认;至于具体的性能提升幅度,仍应等官方更新日志、技术报告或可复现测试补全。

对 Agent 开发者来说,变化不只是一串版本号

如果应用只是单轮问答,底层模型更换带来的影响有时不明显。可 Agent 往往不是这样工作。

它会读仓库、拆任务、调工具、在多轮里保留状态,最后把结果交给人或另一个系统。一个版本切换可能不改变 API schema,却会改变某些实际行为:工具参数是否更稳定、长上下文到后半程是否容易偏题、代码修改后是否更愿意主动验证、思考模式的 token 消耗是否变高。

稳定调用名与实际版本的变化关系

这也是 1M context 和 384K output 不能只看成宣传数字的原因。

1M context 允许把更大的代码库、文档集或历史任务记录放进一次会话,但不意味着每一次都应该塞满。上下文越长,缓存命中、首 token 延迟、工具调用轮数和失败重试的成本都会被放大。384K output 也不代表一次输出越长越好。对生产 Agent 来说,过长输出经常意味着任务边界没有切好,或者模型在没有外部验证的情况下持续扩写。

DeepSeek 官方 V4 预览版效率图

图片来源:DeepSeek V4 Preview Release。该图展示 V4 预览版的公开效率材料,作为长上下文讨论的背景,不用于说明 V4 Pro-0813 的单独效果。

模型更新以后,最容易被忽略的并不是“回答质量有没有变好”,而是原先隐含的工程假设有没有被打破。

例如,一个代码 Agent 曾经在 15 次工具调用内完成修复,现在可能需要 8 次,也可能在第 12 次开始反复读取同一文件。前者看起来更便宜,后者则可能让同样的任务成本翻倍。只比较一两个 benchmark 分数,很难看到这些变化。

别把 model ID 当作永远不变的版本号

deepseek-v4-pro 是一个稳定入口,适合大多数人日常接入。它的好处是供应商升级后,使用方不需要改代码。

但稳定入口和固定版本不是同一个概念。

一个更稳的做法,是把 API 模型看作会移动的依赖。应用配置里继续使用稳定 model ID,同时在每次回归记录中写下当时观察到的实际版本名、文档日期、请求参数和价格页快照。这样当某个任务的表现出现变化,团队至少能回答第一个问题:到底是 prompt 变了、工具变了、业务数据变了,还是模型本身已经换了。

这不是要求每个个人开发者都建设复杂的模型治理平台。哪怕只是给关键任务留下一个轻量账本,也比“感觉昨天还好好的”强得多。

一份够用的静默升级检查表

遇到这类变更,先不要急着把新模型说成“更强”或“替代了谁”。可以先做几件很朴素的事。

先确认事实来源。 把模型与价格页、更新日志、接口文档分开保存。文档明确说了什么,就只写到什么程度。媒体转述的 benchmark、群聊截图和榜单页面,可以作为后续观察,不该替代官方说明。

用真实任务回放,而不是临时出题。 选几条最能代表业务的历史任务。代码 Agent 可以选“修一个跨文件 bug”“补一组测试”“执行一次带工具调用的排障”;内容 Agent 可以选“从指定来源生成结构化摘要”。记录成功率、工具调用次数、总 tokens、耗时,以及人工返工量。

把成本拆开看。 输入、缓存命中、输出、思考 tokens 和失败重试常常是不同的账。只看每百万 tokens 的标价,可能会错过更大的变量。一次版本更新后,任务变短了还是变长了,缓存还命不中,往往比单价本身更影响月度成本。

保留一个退路。 对高价值链路,至少要能把关键任务切回前一个经过验证的模型,或者转到另一个兼容后端。回滚不一定是一个按钮,也可以是一段明确的运行手册:什么指标恶化到什么程度,就停止灰度并换回原配置。

Agent 版本升级后的回归检查流程

真正需要升级的是团队的使用方式

DeepSeek V4 Pro-0813 的故事,提醒的不是“模型公司发布得太安静”。API 型模型服务天然会持续更新,静默切换甚至可能是更常见的交付方式。

模型供应商负责提供能力、价格和兼容接口。应用团队负责决定哪些任务可以自动跟随最新版本,哪些任务必须先经过回放验证,哪些失败必须有人工复核。两层职责混在一起,才会出现“同一个 model ID,为什么今天突然不一样了”的无从解释。

Agent 负责把模型能力变成一次次实际操作。版本管理、测试回放、成本监测和回滚机制,则负责在能力变化时给这些操作加上护栏。前者让系统能做事,后者让团队知道它做得对不对、贵不贵,以及出问题时怎么停下来。

V4 Pro-0813 是否会在后续官方公告中带来更完整的性能说明,当然值得继续关注。但在公告出现之前,开发者已经可以先做一件更有把握的事:拿自己的任务跑一遍,再决定它值不值得进入生产链路。

参考来源

以上来源用于确认公开文档中的版本、接口和价格信息,以及观察第三方报道与生态记录。它们不等同于独立的、可复现的模型能力基准测试。

RSS Feed 使用 Hugo 构建
主题 StackJimmy 设计