DeepSeek V4.1 Flash内测:原生多模态实测破500 tokens/s
9月9日,腾讯研究院AI速递显示,DeepSeek宣布V4.1 Flash中间版本开启内测。新版本采用全新模型结构,原生支持多模态,在能力、速度与成本三方面同步优化,被业界视为DeepSeek新一轮模型更新周期的信号。
核心变化:从纯文本到原生多模态
与此前版本相比,V4.1 Flash最显著的变化是原生多模态能力的引入。开发者无需改动接入地址,只需在原有base_url基础上,将模型名改为 deepseek-v4.1-flash-expires-on-0910 即可调用,计费标准与现有V4 Flash保持一致。
- 模型名:deepseek-v4.1-flash-expires-on-0910
- 调用方式:base_url不变,仅替换模型名
- 计费规则:与V4 Flash相同
- 限流策略:每账号20并发
- 下线时间:9月10日自动下线
速度实测:最高507 tokens/s
开发者实测显示,V4.1 Flash最高输出速度达到507 tokens/s,多人协同测试平均超过300 tokens/s。对于追求实时交互与高吞吐的应用场景,这样的速度意味着更短的等待与更低的单次成本。
| 维度 | V4.1 Flash(内测) | 说明 |
|---|---|---|
| 模态 | 原生多模态 | 新结构原生支持 |
| 实测速度 | 最高507 tokens/s | 平均超300 tokens/s |
| 并发限制 | 每账号20 | 9月10日下线 |
| 计费 | 同V4 Flash | 成本持平 |
FAQ
Q1:V4.1 Flash是正式版吗?
不是。它属于中间版本内测,模型名带有 expires-on-0910 后缀,将在9月10日自动下线,主要用于收集反馈与压测。
Q2:现有业务需要改动代码吗?
不需要大改。保持base_url不变,仅将模型名切换为 deepseek-v4.1-flash-expires-on-0910 即可,计费与限流沿用现有规则。
Q3:为什么速度能做到500+ tokens/s?
新版本采用全新模型结构,在架构层面优化了解码效率,使得在同等硬件下输出吞吐大幅提升,开发者实测最高达到507 tokens/s。
Q4:这次内测释放了什么信号?
从纯文本到原生多模态、从慢速到500+ tokens/s,V4.1 Flash被视为DeepSeek新一轮模型更新周期的开端,后续正式版本值得持续关注。
© 版权声明
本网站名称:修愚分享,本站永久网址:https://xiuyu.com
本网站的文章部分内容来源于网络,仅供大家学习与参考,如有侵权,请联系站长 QQ:24844 进行删除处理。本站一切资源不代表本站立场,不代表本站赞同其观点和对其真实性负责。本站一律禁止以任何方式发布或转载任何违法的相关信息,访客发现请向站长举报。本站资源大多存储在云盘,如发现链接失效,请联系我们我们会第一时间更新。
本网站的文章部分内容来源于网络,仅供大家学习与参考,如有侵权,请联系站长 QQ:24844 进行删除处理。本站一切资源不代表本站立场,不代表本站赞同其观点和对其真实性负责。本站一律禁止以任何方式发布或转载任何违法的相关信息,访客发现请向站长举报。本站资源大多存储在云盘,如发现链接失效,请联系我们我们会第一时间更新。
THE END














![修愚分享推广计划正式上线,推广可获高额奖励[限时推广]-修愚](https://xiuyu.com/wp-content/uploads/2025/05/愚你同乐-1024x410.jpg)


暂无评论内容