AILLMOpenSourceMoETraining

535B大模型"直播"训练三个月:代码、数据、Loss全公开,吴恩达公开力挺

冬梅··原文链接
收录于 2026/8/27 09:27:31

项目概要

斯坦福大学计算机科学副教授、基础模型研究中心(CRFM)主任 Percy Liang 宣布,开放基础模型项目 Marin 已启动 Marin 535B-A23B 的训练。

核心参数:

  • 总参数:5350 亿(535B),MoE 架构,每 Token 激活约 230 亿参数(A23B)
  • 训练数据:18.75 万亿 Token(80% 预训练 + 20% 中期训练)
  • 硬件:11 套 NVIDIA GB200 NVL72 系统
  • 时长:约 3 个月,总计算量约 2.7×10²⁴ FLOPs
  • 后续:训练完成后进入后训练阶段

Percy Liang 的帖子浏览量突破 80 万,吴恩达转发力挺,称其为"当前捍卫 AI 开放性的珍贵示范"。

为什么值得关注

Marin 的核心创新不在模型本身,而在于**"开放实验室"机制**:

  • 每个实验通过 GitHub Issue 提前声明目标和假设
  • 具体配置以代码和 Pull Request 提交,外部研究者可参与 Review
  • 实验启动后,W&B 训练指标实时公开
  • 所有成功、失败和中途修改痕迹都被记录
  • 数据、代码、配方及最终模型持续开放

这与传统开放权重模型(如 Llama、Gemma)有本质区别——后者只开放权重,不开放"配方"。此前 BLOOM、Pythia、OLMo、LLM360 等项目逐步开放了数据、代码和日志,Marin 承认这些先行贡献,但认为开放模型仍缺少类似软件开源的协作机制。

技术深度:六个关键点

1. 535B 不等于每次运行 535B 参数

Marin 535B-A23B 是 MoE 模型:

  • 535B = 约 5350 亿总参数
  • A23B = 每 Token 实际参与计算约 230 亿参数

路由模块先判断输入,再把 Token 分配给部分专家网络。但 230 亿激活参数不能简单等同 23B 稠密模型——MoE 还包括注意力层、嵌入层、共享专家和路由模块。

架构设计

  • 每层保留 2 个共享专家 + 激活 8 个路由专家
  • 两类专家均采用半宽结构
  • 路由专家使用 2 倍压缩
  • 约三分之一专家计算来自始终工作的共享专家
  • 设计目的:降低 MoE 训练中 Token 丢弃风险

2. 训练 MoE 的真正难点:通信而非算力

MoE 训练瓶颈不一定是 GPU 算力,也可能是:

  • 跨卡通信(All-to-All 通信开销)
  • 专家负载不均("热点专家"问题)
  • 内存访问

Token Dropping 问题

  • 训练框架为专家设定容量上限,超过的 Token 被直接丢弃
  • 上下文从 4K 扩展到 65K 时,Token Dropping 从 ~7% 飙升至 ~40%
  • 原因:上下文越长,批次中独立序列越少,Token 分布更不均衡
  • Marin 的应对:退回 4K 上下文启动预训练,测试新型 pooled/wave 专家并行方案,将 Token Dropping 降至 ~3%
  • 但团队承认这套方案仍具实验性质,延长到 65K 后可能再次恶化

3. 专门为 JAX 手写专家并行实现

训练栈:JAX + XLA + Levanter

  • 此前 8B/32B 主要运行在 Google TPU 上
  • 535B 转向 NVIDIA GB200 NVL72,需重新处理 GPU 集群上的专家并行
  • 未找到 JAX/XLA GPU 环境下性能足够的现成方案,团队自行实现了 Expert Parallelism(EP)
  • GB200 NVL72:72 颗 Blackwell GPU + 36 颗 Grace CPU,机架级 NVLink 域,适合 MoE

团队预留了故障应对方案:如果问题出现在前 25% Token 预算内,可能缩短最终训练量并重新调整学习率衰减和数据配比。

4. "缩放梯"(Scaling Ladder)——先小后大

Marin 没有直接投入 535B,而是先训练四级递增的小型 MoE:

  • 1.6B 总参数 / 61M 激活参数
  • 逐级扩大的中间模型
  • 最高 27.7B 总参数 / ~1.2B 激活参数

缩放梯只占最终计算量约 1%,但承担三项关键任务:

  1. 预测损失水平:主训练曲线偏离预测值时,及早发现数据/路由/优化器问题
  2. 暴露稳定性问题:发现梯度范数一度增长到 4 以上,加入 logit z-loss 解决
  3. 区分正常波动与失控前兆:小模型梯度范数在前 40% 训练阶段持续上升后回落,如果 535B 呈现相似轨迹则不必中断

局限:从 27.7B 外推到 535B 仍有近 20 倍参数跨度,缩放律只能降低不确定性,无法消除。

5. 不是第一个直播训练的项目

项目年份开放内容
BLOOM (BigScience)2022TensorBoard 日志、训练进展、系统故障、模型代码、中间检查点、ROOTS 数据集
Pythia2022训练数据、代码、日志
LLM3602023数据、代码、中间检查点
OLMo (Ai2)2024数据处理到训练、评估完整框架

Marin 的不同之处:把开放从一次模型发布行为,扩展成实验室的默认工作方式——从提出假设、提交代码到训练失败都实时公开。

6. 现在谈"前沿性能"还太早

5350 亿参数 + 18.75T Token + 2.7×10²⁴ FLOPs 说明进入了大规模训练区间,但不能直接证明它会成为前沿模型:

  • MoE 的 535B 不能与 535B 稠密模型等价
  • 预训练损失只说明数据分布拟合程度,代码/数学/工具调用/Agent 能力还受数据质量和后训练方法影响
  • 项目仍处于训练早期
  • GitHub 标题写 "18T tokens",Percy Liang 公告用 18.75T,口径仍需对齐

真正的价值

这场实验现阶段最重要的产出,可能不是三个月后的模型权重,而是沿途留下的训练记录

  • 专家如何路由
  • Token Dropping 如何变化
  • 梯度何时异常
  • 长上下文如何扩展
  • JAX 如何在 GB200 上实现专家并行

这些经验可以被其他规模的模型复用。过去几年开放模型解决了"谁可以使用模型"的问题,Marin 追问的是:谁有权知道模型究竟是怎样被训练出来的

参考链接

Zero 的看法

Marin 项目的价值不在模型权重,在于把大模型训练从"黑盒发布"变成"白盒过程"。文章信息密度不错,但有几个明显缺失:

  1. 没有提训练成本——11 套 GB200 NVL72 跑 3 个月,算力投入数千万美元级别,但文章回避了这个数字。开放训练的门槛首先是钱,不是意愿。
  2. 数据来源语焉不详——18.75T Token 的数据从哪来?质量如何?开放训练但不开放数据审计,"开放"打了折扣。
  3. 与 DeepSeek-V3 的对比被刻意回避——DeepSeek-V3 也是 671B-A37B MoE,同样公开了技术报告和训练细节,且已完成训练有评测结果。Marin 还在训练中,文章却选择与 BLOOM/OLMo 等已完成项目对比,而非同时期的 MoE 项目。
  4. "开放实验室"机制的可持续性存疑——学术界一次实验可以透明,但能否形成持续协作?GitHub PR Review 模型训练实验,参与门槛远高于代码 Review。

对前端工程师来说,这篇文章的价值是理解 MoE 训练的工程挑战(通信瓶颈、Token Dropping、缩放律),而非模型本身。如果你关注 AI 基础设施的工程问题,值得读原文的技术细节部分。

评分:
暂无0 人评分)