DeepSeek V4.1 Flash内测:原生多模态实测破500 tokens/s

DeepSeek V4.1 Flash内测:原生多模态实测破500 tokens/s

9月9日,腾讯研究院AI速递显示,DeepSeek宣布V4.1 Flash中间版本开启内测。新版本采用全新模型结构,原生支持多模态,在能力、速度与成本三方面同步优化,被业界视为DeepSeek新一轮模型更新周期的信号。

核心变化:从纯文本到原生多模态

与此前版本相比,V4.1 Flash最显著的变化是原生多模态能力的引入。开发者无需改动接入地址,只需在原有base_url基础上,将模型名改为 deepseek-v4.1-flash-expires-on-0910 即可调用,计费标准与现有V4 Flash保持一致。

  • 模型名:deepseek-v4.1-flash-expires-on-0910
  • 调用方式:base_url不变,仅替换模型名
  • 计费规则:与V4 Flash相同
  • 限流策略:每账号20并发
  • 下线时间:9月10日自动下线

速度实测:最高507 tokens/s

开发者实测显示,V4.1 Flash最高输出速度达到507 tokens/s,多人协同测试平均超过300 tokens/s。对于追求实时交互与高吞吐的应用场景,这样的速度意味着更短的等待与更低的单次成本。

维度 V4.1 Flash(内测) 说明
模态 原生多模态 新结构原生支持
实测速度 最高507 tokens/s 平均超300 tokens/s
并发限制 每账号20 9月10日下线
计费 同V4 Flash 成本持平

FAQ

Q1:V4.1 Flash是正式版吗?

不是。它属于中间版本内测,模型名带有 expires-on-0910 后缀,将在9月10日自动下线,主要用于收集反馈与压测。

Q2:现有业务需要改动代码吗?

不需要大改。保持base_url不变,仅将模型名切换为 deepseek-v4.1-flash-expires-on-0910 即可,计费与限流沿用现有规则。

Q3:为什么速度能做到500+ tokens/s?

新版本采用全新模型结构,在架构层面优化了解码效率,使得在同等硬件下输出吞吐大幅提升,开发者实测最高达到507 tokens/s。

Q4:这次内测释放了什么信号?

从纯文本到原生多模态、从慢速到500+ tokens/s,V4.1 Flash被视为DeepSeek新一轮模型更新周期的开端,后续正式版本值得持续关注。

© 版权声明
THE END
喜欢就支持一下吧
点赞7 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容