DeepSeek-V4-Flash正式版公测:50分逼近GPT-5.6,成本低六成

DeepSeek-V4-Flash正式版公测:50分逼近GPT-5.6,成本低六成

2026年7月31日,DeepSeek通过API文档更新日志宣布:DeepSeek-V4-Flash正式版API上线公测。次日,Artificial Analysis与Arena.ai两大评测平台同步更新基准结果——DeepSeek V4 Flash 0731在Artificial Analysis智能指数(AII)中拿到50分,比2026年4月发布的Flash预览版高出10分,比DeepSeek V4 Pro高出6分,距离榜首的OpenAI GPT-5.6 Luna(51分)只差1分。

更关键的是价格。就在OpenAI把GPT-5.6 Luna价格下调80%之后,DeepSeek V4 Flash在自家API上的单任务成本,仍然比对手低约60%。

一、这次更新到底改了什么

官方口径很克制:DeepSeek-V4-Flash-0731的模型结构、尺寸与此前的preview版本完全一致,只是重新做了后训练,并针对接口调用场景做了专项优化。但从跑分看,这次后训练的收益相当可观。

  • 原生支持Responses API格式,并针对Codex场景做了深度适配
  • Agent能力大幅增强,多项智能体基准测试成绩显著提升
  • 思考/非思考双模式,输出定价低至0.28美元/百万token
  • 约98%的缓存命中折扣,远超业内普遍的90%水平

DeepSeek在更新说明里写了一句比分数更重要的话:正在将竞争重点从传统对话和代码补全,进一步转向Coding Agent、工具调用和自动化执行。翻译过来就是——模型不想只陪你聊天补代码,它想自己上手干活。

核心参数与跑分一览

项目 DeepSeek-V4-Flash-0731
总参数 / 激活参数 约2840亿 / 130亿(MoE架构)
上下文窗口 100万token
Artificial Analysis智能指数 50分(GPT-5.6 Luna为51分)
Terminal Bench 2.1 82.7
Cybergym 76.7
Toolathlon verified 70.3
NL2Repo / DeepSWE 54.2 / 54.4
输出定价 0.28美元/百万token
缓存命中折扣 约98%

二、为什么98%的缓存折扣是胜负手

很多人只盯着50分和51分的差距,但真正决定企业选型的往往是第二个数字。在Agent场景下,一次任务动辄几十轮工具调用,系统提示词、代码库上下文被反复送入模型,这部分token高度重复。缓存命中折扣从行业普遍的90%提升到98%,意味着重复部分的成本直接砍到原来的五分之一。

换句话说:单看单价,OpenAI降价80%之后已经很凶;但把真实Agent任务的token结构算进去,DeepSeek靠缓存策略把综合成本又压低了约60%。这是工程效率的胜利,不是参数堆出来的。

三、对开发者和创业者意味着什么

结论先给:2026下半年,大模型层的竞争已经从”谁更聪明”转向”谁更便宜地把活干完”。

  • 做AI应用的团队:模型成本不再是主要门槛,产品设计与场景理解才是。同样的预算,能跑的任务量比半年前多几倍
  • 做Coding Agent的团队:Terminal Bench 2.1拿到82.7分,意味着国产模型在终端自动化这类硬任务上已经具备生产可用性
  • 做企业服务的团队:百万token上下文加上MIT开源许可,私有化部署与合规审查的空间明显变大
  • 关注国产替代的投资人:1分的差距背后是完全不同的成本曲线,这才是可持续的竞争优势

DeepSeek同时表示,DeepSeek-V4-Pro正式版将会尽快发布。价格战不会停,只会换战场。

FAQ

Q1:DeepSeek-V4-Flash正式版和preview版有什么区别?

官方说明是模型结构与尺寸完全一致,仅重新进行了后训练,并针对接口调用场景做了专项优化,原生支持Responses API格式、深度适配Codex场景。跑分上智能指数从40分提升到50分。

Q2:50分和GPT-5.6 Luna的51分差距大吗?

在Artificial Analysis智能指数口径下只差1分,属于同一梯队。但成本侧差距明显:即便OpenAI已将GPT-5.6 Luna降价80%,DeepSeek V4 Flash单任务成本仍低约60%。

Q3:为什么DeepSeek能做到成本这么低?

关键在缓存策略。DeepSeek提供约98%的缓存命中折扣,远高于业内普遍的90%。在Agent这类高重复上下文的场景中,这个差异会被成倍放大。

Q4:这次更新对Agent开发者最大的价值是什么?

一是Agent能力实测提升,Terminal Bench 2.1得分82.7、Toolathlon verified得分70.3;二是原生Responses API格式降低了接入改造成本;三是低成本让多轮长链路任务在商业上跑得通。

© 版权声明
THE END
喜欢就支持一下吧
点赞12 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容