阿里Qwen3.8-Flash-Next亮相:混合架构预览Qwen4新方向
2026年8月底,阿里巴巴放出 Qwen3.8-Flash-Next 的开放权重,这是一款预览 Qwen4 架构的多模态 MoE 模型。它用一套新的混合注意力设计,把「大底座、小激活、超长上下文」做到了同一台模型里,被视为下一代 Qwen 架构的方向标。
混合架构到底新在哪
Qwen3.8-Flash-Next 采用 125B 参数的主干,但每次推理仅激活 6B 参数,靠 MoE 稀疏化压住成本。更关键的是它引入了 GDN 与 QSA 两种混合注意力机制,在效率与长上下文建模之间做平衡,被外界视为 Qwen4 架构路线的提前剧透。
关键规格一览
| 维度 | 规格 |
|---|---|
| 模型定位 | 预览 Qwen4 架构的多模态 MoE |
| 主干参数 | 125B,激活 6B |
| 注意力机制 | GDN + QSA 混合注意力 |
| 原生上下文 | 262K,可扩展至 1M token |
| QwenCloud 定价 | 输入 0.16 美元 / 输出 0.47 美元(每百万 token) |
为什么「小激活 + 长上下文」是主旋律
2026年大模型竞争的核心已从「堆参数」转向「用更少 token 做更多事」。轻量级变体、可调节推理档位成为标配,而超长上下文则决定了 Agent 能否处理长程任务。Qwen3.8-Flash-Next 把两者结合,正是这一趋势的缩影。
对开发者的实际价值
- 成本可控:6B 激活参数意味着单次调用算力开销显著低于全量模型。
- 长文本友好:262K 原生上下文、可扩展至 1M,适合文档、代码库、多轮 Agent 任务。
- 架构前瞻:提前接触 Qwen4 路线,便于后续迁移与适配。
FAQ
Q1:Qwen3.8-Flash-Next 和之前的 Qwen3.8-Max 有何区别?
Qwen3.8-Max 是 2.4T 参数的 Max 级旗舰并对外开放权重,而 Flash-Next 是更小巧、采用新混合架构、预览 Qwen4 方向的 MoE 模型,主打效率与长上下文。
Q2:GDN 与 QSA 混合注意力解决什么问题?
它们用于在模型效率与长序列建模能力之间取得平衡,让大底座模型在保持低成本激活的同时,仍能处理超长上下文任务。
Q3:262K 上下文可扩展至 1M 意味着什么?
意味着模型可原生处理长文档、大型代码库与多轮复杂 Agent 流程,减少分段拼接带来的信息损耗。
Q4:开发者现在能用上吗?
阿里已放出开放权重,并在 QwenCloud 提供调用,输入 0.16 美元、输出 0.47 美元每百万 token,便于低成本接入与验证。
© 版权声明
本网站名称:修愚分享,本站永久网址:https://xiuyu.com
本网站的文章部分内容来源于网络,仅供大家学习与参考,如有侵权,请联系站长 QQ:24844 进行删除处理。本站一切资源不代表本站立场,不代表本站赞同其观点和对其真实性负责。本站一律禁止以任何方式发布或转载任何违法的相关信息,访客发现请向站长举报。本站资源大多存储在云盘,如发现链接失效,请联系我们我们会第一时间更新。
本网站的文章部分内容来源于网络,仅供大家学习与参考,如有侵权,请联系站长 QQ:24844 进行删除处理。本站一切资源不代表本站立场,不代表本站赞同其观点和对其真实性负责。本站一律禁止以任何方式发布或转载任何违法的相关信息,访客发现请向站长举报。本站资源大多存储在云盘,如发现链接失效,请联系我们我们会第一时间更新。
THE END














![修愚分享推广计划正式上线,推广可获高额奖励[限时推广]-修愚](https://xiuyu.com/wp-content/uploads/2025/05/愚你同乐-1024x410.jpg)


暂无评论内容