视频生成赛道正从「会出一段片」转向「能吃下完整创作上下文」——MiniMax把答案写成了H3,并公开承诺开源权重。
MiniMax(稀宇科技)是国内人工智能公司,业务覆盖语言模型、视频生成、语音与音乐等方向,并以API与消费级产品并行推进商业化。过去视频生成长期被闭源模型主导:迭代快、生态却相对封闭,创作者想「参考这段运镜、那张人脸、这段歌声一起生成」,往往要在多个专家模型之间来回倒腾。H3试图把这条链路收进同一个通用模型里。
7月31日,MiniMax正式发布通用全模态生成模型MiniMax H3。官方定位显示,H3可对文本、图像、视频、声音组成的多模态上下文做统一理解,并输出具备原生双声道的音视频,最高支持约15秒、2K分辨率。产品侧强调,邀测反馈显示其在指令遵循、文字与品牌信息呈现、视频到视频动作迁移(V2V Motion Transfer)等方面表现突出,面向广告、品牌、电商、产品设计、UI/UX与游戏等商业场景。同一天,字节跳动Seed团队亦发布视频模型升级,视频生成赛道同日出现高强度对决。
产品与商业要点:
所谓全模态上下文,白话就是:你可以把参考视频的运镜、参考图的人物、参考音频的歌声一并丢给模型,再用一句话说明它们如何组合成片——模型自己完成跨模态对齐,而不是让人先剪一版「伪参考」再硬套。In-context Regeneration则像让模型「带着原稿上下文再画一遍高清」,而不是靠传统超分去猜细节;对品牌小字、道具纹理这类信息,这种路径往往比纯放大更靠谱。
行业背景也不复杂。文生视频已经过了「能不能动」的新鲜期,下一步比的是可控、可商用、可接入生产线:文字是否糊、主体是否漂移、音画是否对得上、价格能不能撑起日更投放。闭源路线靠效果与渠道卡位;开源路线一旦权重落地,会把定制、私有化与国产芯片适配空间一并打开。MiniMax把低价、2K默认和开源承诺叠在一起,等于同时打价格战与生态战。
对创作者来说,提示词正在变成「导演说明」:说清楚素材之间的关系,比堆华丽形容词更重要。对行业来说,开源承诺与低价策略叠在一起,会直接冲击闭源视频模型的收费与生态壁垒。下一观察点很具体:权重何时真正放出、国产芯片适配是否可复现,以及商用场景里文字渲染与长镜头稳定性能否扛住真实投放压力。