MiniMax|H3正式开源,多家芯片厂商同日适配

PromptTree|阅读 0
2026/08/04 08:39
MiniMaxH3视频生成开源多模态
继发布并宣布8月3日零点开源后,MiniMax于8月3日正式放出H3权重(Hugging Face等渠道,Community License);H3-Omni-Transformer约33B,最高约15秒2K原生立体声音频视频;稀疏注意力与Context-IR等模块暂未开源;华为昇腾、摩尔线程等及AMD、Intel等同日适配,API约0.8元/秒(2K)。

开源承诺从「8月3日零点」变成可下载的权重与同日适配清单——对想私有化部署视频生成的团队,这比再听一遍发布会更关键。

MiniMax(稀宇科技)是国内多模态与大模型厂商,此前已开源多代M系列文本模型;H3是其首款开源多模态生成模型,定位通用全模态系统:统一理解文本、图像、视频与音频上下文,并可生成最高约2K分辨率、最长约15秒、带原生立体声音频的视频。所谓全模态,白话就是输入不必只是一段提示词,还可以混着参考图、参考视频与音频,让模型按「整段上下文」而不是单句文案来生成。此前公开信息已跟踪其产品发布与「北京时间8月3日零点开源」日程;今日续报的是权重真正落地与生态同日跟进。

8月3日,MiniMax宣布H3正式开源,权重可在Hugging Face等渠道获取(如MiniMaxAI/MiniMax-H3),协议为MiniMax H3 Community License。官方说明系统由上下文理解与编排、基础音视频生成、以及2K重生成等模块组成;首期开源以可下载的Omni Transformer权重与相关组件为主。

开源落地与生态要点:

  1. 规格:输出时长约4–15秒;默认较短边约768像素,2K可经H3-Regenerate-2K路径获得;约24 FPS;音频约32 kHz立体声;多语言对话支持。
  2. 权重:H3-Omni-Transformer约33B稠密参数;提供FL2VA(文生/首尾帧)与Ref2VA(多模态参考)等任务检查点。
  3. 边界:首期提供全注意力推理路径;稀疏注意力实现与部分上下文预处理模块(如H3-Context-IR)尚未一并开放,后续将另行发布;完整2K工作流可通过官方API验证。
  4. 适配:公开信息称华为昇腾、摩尔线程、沐曦、海光、昆仑芯、天数智芯、壁仞,以及AMD、Intel等芯片厂商,连同Hugging Face、魔搭ModelScope、ComfyUI等社区与推理框架,在开源同日完成相关适配。
  5. 价格:视频生成API公开口径约0.8元/秒(2K),称约为同类旗舰的三分之一。

读这类开源,要分清「权重可下」与「官方生产管线可完整复现」。缺省的Context-IR与稀疏注意力,意味着社区复现官方画质与成本曲线仍有缺口——本地能跑,不等于默认就能对齐线上效果与延迟。Community License也不同于宽松的Apache 2.0:商用、再分发与「模型即服务」场景的具体约束,需要团队法务对照协议文本,而不是只看「开源」两个字。

把背景拉开,视频生成赛道过去一年卷的是时长、分辨率、可控性与单价。闭源旗舰用画质与生态锁客;开源阵营则用可私有化、可微调换取开发者与中小团队。MiniMax选择先把H3做成「可下载的全模态底座」,再用同日芯片与社区适配降低「下下来跑不起来」的摩擦,策略很清晰:文本侧已有M系列开源心智,多模态侧要用H3补齐第一块可落地的权重拼图。对国产算力栈,同日适配名单本身就是信号——模型发布若只绑单一CUDA路径,私有化客户会直接卡在机房。

对企业与创作者,眼前价值是可本地试验、可二次微调的底座,以及国产与海外芯片栈的即日适配降低上线摩擦。对产业观察者,下一观察点是稀疏注意力与预处理模块何时补齐、Community License在商用场景下的实际约束,以及开源后的社区复现报告能否把「15秒2K」从海报翻译成稳定流水线——权重落地只是起点,生态是否长出工具链,才决定H3会不会变成默认选项。