MiniMax|H3明确8月3日零点开源(续)

PromptTree|阅读 0
2026/08/02 08:28
MiniMaxH3视频生成开源多模态
继7月31日发布H3并称将于未来几天内开放权重后,公开信息进一步明确:MiniMax通用全模态生成模型H3计划于北京时间8月3日零点在魔搭社区正式开源;H3最高约15秒2K原生双声道音视频,主打商用可控与性价比。

开源承诺从「未来几天」收成日历上的一个零点——对想私有化部署的团队,这比再听一遍产品发布更关键。

MiniMax(稀宇科技)是国内人工智能公司,业务覆盖语言模型、视频生成、语音与音乐等,API与消费级产品并行推进。7月31日,公司正式发布通用全模态生成模型MiniMax H3:可对文本、图像、视频、声音组成的多模态上下文做统一理解,并输出具备原生双声道的音视频,最高约15秒、2K分辨率;产品侧强调指令遵循、文字与品牌信息呈现、视频到视频动作迁移(V2V Motion Transfer)等,面向广告、品牌、电商、产品设计、UI/UX与游戏等商业场景。当时官方口径是:为推动开源社区与国产芯片适配,计划在未来几天内、在符合相关法律法规前提下开放模型权重。

此后公开信息进一步收束时间点:H3计划于北京时间8月3日零点在魔搭社区正式开源。对关注本地部署、二次微调与国产芯片适配的开发者与企业客户而言,模糊窗口变成了可排期的节点——采购、机位与评测日历可以往「开源后第一周」对齐,而不必继续停在「等通知」。

产品能力与商业主张(便于新读者一次读懂):

  1. 能力边界:从特化任务模型走向通用多模态助手,用自然语言描述素材关系与创作意图,而不仅是简单画面提示词。
  2. 技术组合:Contextual Omni Representation、H3-VAE、H3-Omni Transformer、In-context Regeneration;2K输出不走传统专用超分,而由基模对低分辨率结果做上下文内再生成。
  3. 定价主张:默认提供2K;官方称2K档每秒价格不到主流模型三分之一,768P档约为主流720P的一半。
  4. 开源节奏:设计初期即考虑多款国产芯片兼容性;8月3日零点为目前公开排期中的明确时刻。

所谓全模态上下文,白话就是:你可以把参考视频的运镜、参考图的人物、参考音频的歌声一并丢给模型,再用一句话说明如何组合成片——模型完成跨模态对齐,而不是让人先剪一版「伪参考」再硬套。In-context Regeneration则像让模型「带着原稿上下文再画一遍高清」,对品牌小字、道具纹理往往比纯放大更靠谱。把开源日期钉死,意味着这些能力不只停留在云端API试玩,而可能进入可定制、可私有化的工作流。

视频生成赛道已经过了「会不会动」的新鲜期,下一仗同时打效果、价格与可私有化三张牌。闭源路线靠效果与渠道卡位;开源路线一旦权重落地,会把定制、二次训练与国产芯片适配空间一并打开。MiniMax此前把低价、2K默认和开源承诺叠在一起,等于同时打价格战与生态战;如今时间表落地,行业会立刻用「是否如期、是否好用、许可证是否清晰」三把尺子验收。

对创作者,提示词正在变成「导演说明」:说清楚素材关系,比堆华丽形容词更重要。对企业客户,开源节点决定私有化POC能否启动。下一观察点很直接:8月3日权重与配套技术栈是否如期放出、商用条款是否清楚,以及开源后文字渲染与长镜头稳定性能否在真实投放场景里站住——到期未放或残缺交付,都会迅速反噬此前积累的预期。