Marin 535B开源MoE全程直播训练:把黑箱变成透明实验
2026年8月下旬,由 Percy Liang 领衔的 Marin 项目团队宣布,已开始训练其 535B 参数的 Marin 535B-A23B 模型。这并非一次普通的开源发布,而是一场「把训练全过程摊开给全世界看」的实验——配置、损失曲线、数据构成全部实时公开。
一次「开着门」的训练
过去大模型训练被视为少数巨头的黑箱:数据怎么配比、损失怎么收敛,外界无从得知。Marin 项目反其道而行,把整个训练流程搬到聚光灯下。团队提供对训练配置、损失曲线与数据构成的实时访问权限,任何研究者都能像看实验日志一样观察模型成长。
核心训练参数
| 指标 | 数值 |
|---|---|
| 模型参数规模 | 535B(MoE 架构,A23B 激活) |
| 训练周期 | 约 3 个月 |
| 训练数据量 | 18.75 万亿 token |
| 算力底座 | 11 台 NVIDIA GB200 NVL72 机柜 |
| 公开程度 | 配置 / 损失曲线 / 数据构成 实时开放 |
为什么「透明训练」值得关注
大模型行业长期存在两大痛点:一是训练不可复现,二是能力来源说不清。Marin 的尝试至少回应了三点:
- 可复现性:公开配置与数据构成,让学术圈有机会验证、改进而非盲猜。
- 信任成本:损失曲线实时可见,模型「学到什么、卡在哪里」一目了然。
- 社区协作:开放过程意味着问题能被更早暴露,形成「发布—反馈—改进」的正向循环。
对开源生态意味着什么
2026年开源模型已从「追赶闭源」走向「定义赛道」。中国自研开源模型下载占比已被多家机构测算超过美国,而 Marin 这类从训练阶段就开放的项目,把开源的边界又往前推了一步——不只是权重开放,连「怎么练出来」也开放。
FAQ
Q1:Marin 535B-A23B 是什么类型的模型?
它是一个 535B 参数的混合专家(MoE)模型,采用稀疏激活设计,训练与推理时实际激活的参数规模远低于总参数量,兼顾能力与效率。
Q2:18.75 万亿 token 是什么概念?
这是本轮训练计划处理的总数据量,运行在 11 台 NVIDIA GB200 NVL72 机柜上,训练周期约三个月,属于当前主流前沿级训练规模的公开项目。
Q3:普通开发者能从中获得什么?
团队提供训练配置、损失曲线与数据构成的实时访问,研究者可用于复现、对比、改进自己的训练方案,降低重复造轮子的成本。
Q4:它和常规开源发布有何不同?
常规开源多是「训练完成后放出权重」,Marin 则是「训练过程中全程开放」,把黑箱过程变成可观察、可参与的公开实验。
© 版权声明
本网站名称:修愚分享,本站永久网址:https://xiuyu.com
本网站的文章部分内容来源于网络,仅供大家学习与参考,如有侵权,请联系站长 QQ:24844 进行删除处理。本站一切资源不代表本站立场,不代表本站赞同其观点和对其真实性负责。本站一律禁止以任何方式发布或转载任何违法的相关信息,访客发现请向站长举报。本站资源大多存储在云盘,如发现链接失效,请联系我们我们会第一时间更新。
本网站的文章部分内容来源于网络,仅供大家学习与参考,如有侵权,请联系站长 QQ:24844 进行删除处理。本站一切资源不代表本站立场,不代表本站赞同其观点和对其真实性负责。本站一律禁止以任何方式发布或转载任何违法的相关信息,访客发现请向站长举报。本站资源大多存储在云盘,如发现链接失效,请联系我们我们会第一时间更新。
THE END














![修愚分享推广计划正式上线,推广可获高额奖励[限时推广]-修愚](https://xiuyu.com/wp-content/uploads/2025/05/愚你同乐-1024x410.jpg)


暂无评论内容