535B大模型“直播”训练三个月:代码、数据、Loss全公开,吴恩达公开力挺
日期:2026-09-02 20:54:50 / 人气:16
当大多数模型公司还在围绕“是否开放权重”争论时,一个总参数达到5350亿的大模型,选择在训练尚未完成、甚至仍可能中途失败的时候,把训练曲线、数据配方、模型配置和技术讨论直接放到了网上。
近日,斯坦福大学计算机科学副教授、基础模型研究中心(CRFM)主任Percy Liang在X上发帖宣布,开放基础模型项目Marin已于上周启动Marin 535B-A23B的训练。按照目前公布的计划,Marin 535B-A23B将处理18.75万亿Token,其中约80%用于预训练,20%用于中期训练;训练运行在11套NVIDIA GB200 NVL72系统上(合计约792颗GB200 GPU),预计持续约3个月,总计算量约为2.7×10²⁴ FLOPs,之后还将进入后训练阶段。
据Marin项目发起公告,项目最早诞生于斯坦福大学基础模型研究中心CRFM,于2025年5月正式对外公布。发起公告的作者包括David Hall、Percy Liang,以及来自斯坦福、Open Athena和开放社区的多位研究人员。Percy Liang曾就职于对话式AI公司Semantic Machines担任首席科学家,该公司2018年被微软收购;他也是大模型推理云和开源AI公司Together AI的联合创始人之一。
之所以要做Marin,是因为他们想探索AI领域的一个核心问题:在算力高度集中、训练配方越来越封闭的情况下,基础模型还能不能像开源软件一样被公开研究和共同建设?市面上Llama、Gemma等开放权重模型并未公开生成模型的代码与数据“配方”;BLOOM、Pythia、OLMo、LLM360等进一步开放了数据、代码、日志或中间检查点。Marin承认这些先行贡献,但认为开放模型仍缺一套类似软件开源的协作机制——开发者能在GitHub看Issue、提PR、做Review,而基础模型实验通常在封闭集群运行,外界看不到决策原因与失败实验。
于是Marin提出“开放实验室(Open Lab)”机制:每个实验通过GitHub Issue提前声明目标和假设,具体配置以代码和Pull Request提交,外部可参与Review;实验启动后W&B训练指标公开,所有成功、失败和中途修改痕迹都被记录,数据、代码、配方及最终模型继续开放。截至目前Marin已训练过8B和32B模型,并开始将规模扩大到535B-A23B MoE。
Percy Liang的帖子在X上浏览量突破80万,吴恩达随即转发,称Marin是“当前捍卫AI开放性的一次珍贵示范”,强调其不仅开放模型代码,还公开数据、训练配方和实验过程;“公开发布AI研究成果曾几何时是行业常态;我很感激@percyliang所坚持的开放实验室理念。”不过Marin目前还不是已完成的可比模型,真正引发关注的不是5350亿参数本身,而是把通常被严密保护的训练过程变成了可实时观察与审查的研究对象。
从命名看,Marin 535B-A23B是混合专家模型。“535B”为约5350亿总参数,“A23B”指每处理一个Token实际激活约230亿参数——并非全部参数同时工作,而是由路由模块分配Token给部分专家。这样模型可扩大总容量,单Token计算成本却不随总参数量同步增长。但“230亿激活”也不能简单等同23B稠密模型,MoE还含注意力、嵌入、共享专家与路由模块等常驻或部分参与结构,比较两款MoE需同时看训练Token数、专家数、路由方式、共享专家比例与实际FLOPs。
Marin技术说明显示,该模型每层保留2个共享专家、激活8个路由专家,两类专家均半宽,路由专家再用2倍压缩,约三分之一专家计算来自始终工作的共享专家——目的是降低MoE训练中的Token Dropping风险。MoE优势是计算稀疏,工程代价是All-to-All通信复杂:Token按路由发到不同设备专家,算完送回,瓶颈常在跨卡通信、专家负载不均与显存。容量设太紧会丢Token(Token Dropping),太松则冗余和显存爆炸。Marin此前实验里上下文从4K扩到65K时,Token Dropping曾从约7%升到约40%;因此535B退回4K启动预训练,用pooled/wave专家并行在4K下压到约3%,但团队明确说这套实现仍具实验性,扩到65K可能再次偏高。
训练栈基于JAX、XLA和Levanter。此前8B/32B跑在Google TPU上,本次535B转向GB200 NVL72,团队因JAX/XLA GPU环境缺成熟EP方案,自行手写了Expert Parallelism,性能依赖All-to-All与专家计算重叠。GB200 NVL72把72颗Blackwell GPU与36颗Grace CPU组织进机架级NVLink域,适合高通信MoE。项目也预留了故障应对:若前25% Token预算内出硬件故障或MFU下降,可能缩最终Token量、调线性学习率衰减和数据配比,而非机械跑原计划。
直接砸全部算力跑535B风险太高,Marin先搭了四级Scaling Ladder:1.6B总参/61M激活、中间档、到27.7B总参/约1.2B激活,缩放实验仅占主跑算力约1%。作用不是证明535B能力,而是用低成本拟合损失-计算量-规模关系、预测主训练各阶段Loss、提前暴露稳定性问题(如早前发现长周期训练梯度范数涨到4以上,靠加logit z-loss控住),并区分“正常波动”和“失控前兆”。从27.7B外推到535B仍有近20倍总参跨度,缩放律只降不确定性不消不确定性。
它不是第一个直播训练的大模型。2022年BigScience训BLOOM(176B)就公开过TensorBoard与故障处理;Pythia、LLM360、AI2的OLMo进一步开放数据/代码/日志/中间检查点。Marin自己也没自称第一,公告里直接列了EleutherAI、AI2、Hugging Face、BigScience、BigCode、LLM360等先行者,只说“再向前一步”:把开放从一次模型发布行为,扩展成实验室默认工作方式——从提假设、交代码到训练失败都尽量实时公开。
现在谈“前沿性能”太早。535B总参+18.75T Token+2.7e24 FLOPs说明进入超大规模区间,但MoE不能等同稠密模型,预训练Loss只反映数据拟合,代码/数学/Agent能力还看数据质量、中期训练与后训练;且项目仍在早期,GitHub Issue标题写“18T tokens”而对外公告用18.75T,也说明计划口径还在对齐。
这场实验现阶段最重要产出,可能不是三个月后的权重,而是沿途留下的训练记录:专家怎么路由、Token Dropping怎么变、梯度何时异常、长上下文怎么扩、JAX怎么在GB200上写EP——这些经验可被小几十倍规模的团队复用。过去开放模型解决“谁能用模型”,Marin继续追问“谁有权知道模型究竟怎么被练出来”。成了,社区多一套大规模MoE样本;中途挂了,公开的故障路径同样有研究价值。

作者:杏耀注册登录测速平台
新闻资讯 News
- 给自然留一个位置:深圳生物友好...09-06
- 三只松鼠想通了:零食店的尽头,...09-06
- GPT‑6踩了脚刹车09-06
- 驶入长夜两年,蕉下迎来黎明?09-06

