Marin 535B开源MoE全程直播训练:把黑箱变成透明实验

Marin 535B开源MoE全程直播训练:把黑箱变成透明实验

2026年8月下旬,由 Percy Liang 领衔的 Marin 项目团队宣布,已开始训练其 535B 参数的 Marin 535B-A23B 模型。这并非一次普通的开源发布,而是一场「把训练全过程摊开给全世界看」的实验——配置、损失曲线、数据构成全部实时公开。

一次「开着门」的训练

过去大模型训练被视为少数巨头的黑箱:数据怎么配比、损失怎么收敛,外界无从得知。Marin 项目反其道而行,把整个训练流程搬到聚光灯下。团队提供对训练配置、损失曲线与数据构成的实时访问权限,任何研究者都能像看实验日志一样观察模型成长。

核心训练参数

指标 数值
模型参数规模 535B(MoE 架构,A23B 激活)
训练周期 约 3 个月
训练数据量 18.75 万亿 token
算力底座 11 台 NVIDIA GB200 NVL72 机柜
公开程度 配置 / 损失曲线 / 数据构成 实时开放

为什么「透明训练」值得关注

大模型行业长期存在两大痛点:一是训练不可复现,二是能力来源说不清。Marin 的尝试至少回应了三点:

  • 可复现性:公开配置与数据构成,让学术圈有机会验证、改进而非盲猜。
  • 信任成本:损失曲线实时可见,模型「学到什么、卡在哪里」一目了然。
  • 社区协作:开放过程意味着问题能被更早暴露,形成「发布—反馈—改进」的正向循环。

对开源生态意味着什么

2026年开源模型已从「追赶闭源」走向「定义赛道」。中国自研开源模型下载占比已被多家机构测算超过美国,而 Marin 这类从训练阶段就开放的项目,把开源的边界又往前推了一步——不只是权重开放,连「怎么练出来」也开放。

FAQ

Q1:Marin 535B-A23B 是什么类型的模型?

它是一个 535B 参数的混合专家(MoE)模型,采用稀疏激活设计,训练与推理时实际激活的参数规模远低于总参数量,兼顾能力与效率。

Q2:18.75 万亿 token 是什么概念?

这是本轮训练计划处理的总数据量,运行在 11 台 NVIDIA GB200 NVL72 机柜上,训练周期约三个月,属于当前主流前沿级训练规模的公开项目。

Q3:普通开发者能从中获得什么?

团队提供训练配置、损失曲线与数据构成的实时访问,研究者可用于复现、对比、改进自己的训练方案,降低重复造轮子的成本。

Q4:它和常规开源发布有何不同?

常规开源多是「训练完成后放出权重」,Marin 则是「训练过程中全程开放」,把黑箱过程变成可观察、可参与的公开实验。

© 版权声明
THE END
喜欢就支持一下吧
点赞15 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容