GPT-4们如何炼成,长期是黑箱;Marin把熔炉搬到直播间——Loss曲线比发布会更诚实。对研究者与创业团队而言,这不只是围观,而是第一次近距离核对「Scaling预测到底靠不靠谱」。
斯坦福大学教授、Simile AI创始人Percy Liang通过Marin开放实验室宣布,正式启动MoE大模型Marin 535B-A23B训练,并全程公开数据构成、工程配置与实时loss。模型总参数约5350亿、激活约230亿,训练数据约18.75万亿token,部署11套GB200 NVL72系统(约792颗GB200 GPU),预计连续训练约三个月,总算力约2.7e24 FLOPs,完成后还将进行后训练。
开放尺度可核对资源:
所谓MoE(混合专家),白话是每次只激活一部分专家子网络,用「总参数大、单次激活小」换效率;所谓Scaling Ladder,白话是先用小模型阶梯试跑,再外推到主训练,降低一次性炸炉的概率。商业前沿实验室通常只公开分数与少量论文描述,数据配比、失败超参与loss拐点极少外泄。Marin试图把训练过程做成可观察、可讨论、可协作的公共品——哪怕过程中出现爆炸与偏离预期,也不隐藏。
产业观察上,这与封闭前沿实验室形成对照:商业模型只见分数不见失败,Marin把「炸炉」也当作教材。对资本,则提醒「训练即壁垒」的同时,壁垒也可能被直播稀释。可以把它想成:米其林厨房开放透明玻璃——秘方仍难抄,但火候节奏瞒不住。对开源社区,价值在于验证数据配比与工程配置是否可复现,而不只是围观跑分。
需要把边界读清楚。开放不等于权重即时开源;三个月内仍可能出现中断与策略调整。下一观察点是后训练阶段对齐数据与最终开放许可范围。