Sand.ai|开源MAGI-2 Preview:114B总参激活约6B,统一音视频生成

PromptTree|阅读 0
2026/08/06 10:08
Sand.aiMAGI-2MoE视频生成开源
北京创企Sand.ai近日发布并开源MAGI-2 Preview,总参约114B、单次激活约6B,采用单流统一音视频与Multi-Head MoE;权重与代码已开放,Artificial Analysis图生视频榜约全球第六(第三方口径,仍待更广复现)。

视频生成若只堆稠密参数,容量账单会一起爆炸——Sand.ai用千亿级MoE把「装得下」和「算得起」拆开记账。

Sand.ai是北京侧人工智能视频生成创企,产品线围绕音视频联合生成与可扩展训练系统,赛道落在「更长、更稳、更便宜」的生成式视频底座。MAGI-2 Preview是其最新公开的预览模型:定位统一音视频生成,即由同一模型共同输出画面与声音,而不是先出片再配乐、再做口型对齐的级联流水线。对短剧、广告与内容工厂来说,音画若从第一帧就互相看见,后期返工往往少一截。

近日,公司正式发布并开源MAGI-2 Preview。公开规格显示总参数约114B(约1140亿),单次前向激活约6B(约60亿)。架构上,文本、视频与音频进入同一Transformer单流,在每层自注意力中持续交换信息,使口型、表情、动作、对白、环境声与镜头节奏从生成起点便共同建模。相较常见的多流分支再融合,或「画面模型+音频模型」串联,单流减少了跨模块接口与同步维护成本。公司称,模型内部设有共享专家处理跨模态共性特征,同时为文本、视频、音频保留专属专家,用分工消化三种模态的差异。

可核验的架构与工程要点:

  1. 路由:采用Multi-Head MoE,将约3072维隐藏表示拆成12个约256维子空间,每个子空间独立路由、各自选专家,避免「一个token只能找少数万能专家」的粗粒度瓶颈。
  2. 通信:配合Head Parallel,把跨设备通信前置到路由之前,按head分发固定形状表示,降低视频级长序列下专家并行的通信爆炸。
  3. 算子:自研高性能MoE kernel库MagiMoE,覆盖路由、专家排序与专家计算;当前公开路径含经大规模训练验证的Triton/BF16实现。
  4. 优化:采用分布式优化器MagiMuon,以Muon处理主体矩阵参数、AdamW处理更适合常规更新的参数,服务海量细粒度专家的稳定扩展。
  5. 分发:权重与代码已开放,公开通道包括GitHub(SandAI-org/MAGI-2-preview)等;第三方榜单Artificial Analysis的Image to Video中,该预览模型进入全球前十、约排第六(榜单位置随版本变动,公司叙事与第三方榜均需独立复现核对)。

所谓MoE(混合专家),白话就是总参谋部很大,但每次只叫醒少数专家出诊——容量用来装人物、镜头、材质与声音细节,激活参数决定单次算力账单。视频比文本更「吃token」:一秒24帧、每帧切成大量视觉patch,再叠音频与指令,序列长度轻松达到纯文本任务的数百倍。继续放大稠密模型,机器先被拖慢,效果却未必按比例上涨;把大语言模型跑通的稀疏扩展迁到视频,正是Sand.ai此轮开源要验证的主命题。

把时间线放进国内视频赛道节奏:MiniMax刚放出H3开源权重与芯片适配清单;字节侧亦有把单次生成时长继续拉长的产品叙事。竞争焦点正从「能不能出片」转向「能不能在复杂运动与音画同步里稳住,并且账单还扛得住」。Sand.ai选择另一条路——用统一单流换音画一致性,用细粒度MoE换容量,用自研系统栈换「千亿参数真能训得动」。对企业与创作者,眼前价值是可下载的预览底座与可对照的技术路线图;商用许可、本地复现延迟与正式版画质,仍要以仓库说明与实测为准。

需要把边界读清楚。预览版不等于最终产品;榜单第六是阶段性位置,不是合同验收条款。开源「能下」也不等于生产管线「能对齐官方效果」——算子路径、数据配比与后训练对齐都会影响观感。下一观察点是正式版何时补齐更长时长与更高分辨率,以及社区复现报告能否把「114B总参、6B激活」翻译成可对比的生成单价与失败率——权重落地只是起点,生态是否长出可复制的部署手册,才决定MAGI会不会变成默认中间档。