阿里Qwen3.8-Flash-Next亮相:混合架构预览Qwen4新方向

阿里Qwen3.8-Flash-Next亮相:混合架构预览Qwen4新方向

2026年8月底,阿里巴巴放出 Qwen3.8-Flash-Next 的开放权重,这是一款预览 Qwen4 架构的多模态 MoE 模型。它用一套新的混合注意力设计,把「大底座、小激活、超长上下文」做到了同一台模型里,被视为下一代 Qwen 架构的方向标。

混合架构到底新在哪

Qwen3.8-Flash-Next 采用 125B 参数的主干,但每次推理仅激活 6B 参数,靠 MoE 稀疏化压住成本。更关键的是它引入了 GDN 与 QSA 两种混合注意力机制,在效率与长上下文建模之间做平衡,被外界视为 Qwen4 架构路线的提前剧透。

关键规格一览

维度 规格
模型定位 预览 Qwen4 架构的多模态 MoE
主干参数 125B,激活 6B
注意力机制 GDN + QSA 混合注意力
原生上下文 262K,可扩展至 1M token
QwenCloud 定价 输入 0.16 美元 / 输出 0.47 美元(每百万 token)

为什么「小激活 + 长上下文」是主旋律

2026年大模型竞争的核心已从「堆参数」转向「用更少 token 做更多事」。轻量级变体、可调节推理档位成为标配,而超长上下文则决定了 Agent 能否处理长程任务。Qwen3.8-Flash-Next 把两者结合,正是这一趋势的缩影。

对开发者的实际价值

  • 成本可控:6B 激活参数意味着单次调用算力开销显著低于全量模型。
  • 长文本友好:262K 原生上下文、可扩展至 1M,适合文档、代码库、多轮 Agent 任务。
  • 架构前瞻:提前接触 Qwen4 路线,便于后续迁移与适配。

FAQ

Q1:Qwen3.8-Flash-Next 和之前的 Qwen3.8-Max 有何区别?

Qwen3.8-Max 是 2.4T 参数的 Max 级旗舰并对外开放权重,而 Flash-Next 是更小巧、采用新混合架构、预览 Qwen4 方向的 MoE 模型,主打效率与长上下文。

Q2:GDN 与 QSA 混合注意力解决什么问题?

它们用于在模型效率与长序列建模能力之间取得平衡,让大底座模型在保持低成本激活的同时,仍能处理超长上下文任务。

Q3:262K 上下文可扩展至 1M 意味着什么?

意味着模型可原生处理长文档、大型代码库与多轮复杂 Agent 流程,减少分段拼接带来的信息损耗。

Q4:开发者现在能用上吗?

阿里已放出开放权重,并在 QwenCloud 提供调用,输入 0.16 美元、输出 0.47 美元每百万 token,便于低成本接入与验证。

© 版权声明
THE END
喜欢就支持一下吧
点赞10 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容