爱范儿 4小时前
Seedance 级别的全模态控制,MiniMax H3 的商业视频成片新解法
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

今天无处不在的 AI 短片,越来越酷炫的生成效果,会不会给你带来一种错觉:这年头生成视频太轻松了,一句话就行?

在 APPSO,我们尝试了很多不同的视频生成模型,发现答案并没那么简单:那些可以被当做样例展示的「AI 大片」,大多数都是拿 AI 生成一大堆素材,再到视频编辑软件里通过人工后期修剪、配乐、精细调整的结果。

AI 是做到了可以生成越来越像电影的画面,但电影之外,还有一个更大的市场。

每天都有大量广告、电商、游戏、产品发布、UI 展示、品牌包装视频正在制作,它们不一定追求奥斯卡级镜头,却更在意另外几件事:读懂创意需求,对视频进行精准编辑,把原本分散在生成、剪辑、字幕、动效和声音等多个环节的步骤,汇合成一套完整的可交付结果。

今天 MiniMax 发布了新一代开源视频模型 MiniMax H3,有着「Seedance 级别」、「全模态精准控制」,以及「AI 原生后期」能力。

我们想看看,它到底能不能把视频生成里那些额外的工作,也一并给解决?

经过初步测试我们发现,简单的人物 / 背景 / 物体替换、基于参考视频学习风格并复制、根据文字需求直接生成一支产品概念片等,都是它的强项。尤其是针对特效剪辑包装类视频,广告、电商、UI 设计等场景,基本上都有不错的表现。

除了模型的能力,MiniMax H3 还有一个更现实的特点——通过技术积累,给企业客户和创作者带来更低的使用成本。

再加上解决了生成「不可控」、「离成片远」的问题,我们发现 MiniMax H3 不仅作为视频生成模型本身更能打了,也对非视频专业的用户更友好了。

体验地址:hailuoai.com 或下载 MiniMax Hub

给自己 Vibe Coding 的插件做一个宣传片

和 Seedance 一样,H3 也是一款「开放通用多模态视频模型」,它支持文字、图片、视频和音频混合输入,一次最多使用 9 张图片、3 段视频和 3 段音频,混合文件上限为 12 个。

我们直接把前段时间 Vibe Coding 做的一个浏览器标签页总结扩展的截图发给它,一共 7 张图片,再加上 Google 发布的 Materail 3 设计介绍视频。提示词只有一句话,就是要求它根据这些图片内容,制作一个工具介绍视频。

H3 的速度很快,我们选择了两个视频,也不用等很久。最后出来的结果相当意外,根本不需要我们去写任何的转场以及动效,模型自己就知道最合适的呈现方式。

两个视频有不同的效果,但要表达的内容以及产品的主视觉都做到了保持一致。

视频中的主要文字也都能准确渲染,但当遇到较小和密集的文本,H3 还是会偶发乱码的问题。这也让我们发现:大多数情况下,上传图片的画质会决定模型生成的准确性。如果使用的截图,在这些小字部分都足够清晰,视频模型在处理时,能降低很多错误率。

此外,这两个视频都是一次性生成,完全没有抽卡。

能做类似的宣传片,也能覆盖更多场景下的包装成本。从广告、游戏、电商等行业,我们都用 H3 做了一些简单的测试,基本上都能满足最初的交付期待。

先是一个简单的 ID 片头,我们临时编了一个名叫 NULO 的 AI 设计工具,它没有真实产品,也没有现成的 Logo 和 UI。

不同于上一个案例的「无责任」极简提示词,这次我们专门测试了用更详细的提示词进行精细控制,用文字写清画面顺序:三个写着 IMAGE、VIDEO 和 AUDIO 的卡片依次出现,组合成 NULO 字标;字标随后展开为产品界面,增加 EXPORT;最后,所有组件重新收拢成 Logo,出现「MAKE IT MOVE.」。

▲ 生成一支 10 秒、16:9 横版的虚构 AI 设计工具品牌片,品牌只叫「NULO」。这是 motion branding / UI product film,不是人物剧情片。

0 – 2 秒:石墨黑背景,IMAGE、VIDEO、AUDIO 三张素材卡片从画面边缘沿节拍进入,吸附并组合成 NULO 字标。

2 – 5 秒:字标通过形状变形展开为极简产品界面。界面只允许出现四个英文标签:IMAGE、VIDEO、AUDIO、EXPORT。卡片通过遮罩和弹性伸缩进入时间线,当前选中框变为荧光橙。

5 – 8 秒:界面只切换一次,变成最终海报预览;一条荧光橙色轨迹穿过各节点,每经过一个节点就同步一个清晰的点击或滑动音效。

8 – 10 秒:全部 UI 组件收拢回 NULO Logo,结尾标语「MAKE IT MOVE.」停留 1 秒。

要求:所有文字清晰、拼写完全正确、各只出现一次;不要新增单词、按钮、Logo 或人物;品牌色仅用石墨黑、暖灰、荧光橙;转场只用形状变形、遮罩、卡片伸缩与颜色扩散,不用淡入淡出;配原创极简电子音乐,动画节点必须与鼓点和音效同步。

这次,H3 还给生成的视频配上了动感的音乐,视频中四个英文单词都拼对了,石墨黑、暖灰和荧光橙也从头保持到尾。此外,模型还自动加了一块带节点连线的抽象界面,让卡片、字标、轨迹和片尾看起来属于同一套设计——整体上,H3 实现了全方位的一致性,令人满意。

以上都说的是非专业使用习惯。如果换成专业人士的工作习惯,不用提示词,也不让模型发挥想象,直接给它一套完整的分镜图,效果又会怎样呢?

我们先用 GPT Image 2 生成了一张机车的图片,然后根据这张机车图,生成一张机车的 TVC 15s 分镜。

分镜版其实比较模糊,而且图片是横着展开的,不符合一般的分镜设计,但 MiniMax H3 还是读取到了应该要呈现的信息,对画面进行了重新布局。

同时,该显示的文本信息,在做到了字体的完整还原之外,H3 还会进一步理解文字与画面的关系,将文字作为视觉设计元素融入场景,而不仅是简单叠加、生硬地照搬。

就像这里,把机车的名称和 Logo 等文字,没有简单地照搬分镜放在左边,而是放在了机车下方,更符合视频的观看体验。

同样的方式,我们也让 H3 给 iPhone Fold 做了一个 10s 的广告视频。

这些 AI 生成的作品,基本上都能算得上一个完整的 Demo,可以用在社媒、广告或游戏里——

这也是我们在测试后认为 H3 最大的优势:它不但兼容专业视频工作者的工作流,更让非视频专业,但要经常跟视频打交道的那些用户,能够以极低的门槛,制作出优秀的 demo 和提案素材,并且在后续的工作中显著降低非专业用户与专业用户协作时的沟通障碍。

如果说过去用 AI 生成视频,是在给剪辑师「增加找素材的工作量」;那么 H3 给人的感觉,很像是内置了一个懂设计的「AI 后期组」。

我们继续用它来生成一段虚构的时尚品牌片,这次指定了模特、背景甚至还有音乐。

如果去掉视频右下角的水印,很难发现这个视频是由 AI 制作的。MiniMax H3 把我们指定的人物、包袋、汽车和荒漠公路都做到了完美结合,最后还用了一个快速的平移,准确展示所有文本。

随着模型多模态理解、指令遵循等多项能力的提升,H3 可以更好的理解视频内容、用户意图,自动完成特效包装和视觉设计的增强。这些特性的存在,让 H3 在我们的测试中所生成的结果,往往更接近一条成片,而非简单的片段或素材。

除了融合产品 UI 和动态包装,H3 还能生成具备视觉融合度的游戏 HUD 界面。我们用 GPT-Image-2 生成了一张游戏角色的立绘图片,然后要求 H3 根据这张图片生成一支 12 秒、16:9 横版的角色与 UI 包装视频。

还有更简单的产品介绍视频,上传一张产品主图,H3 就能给我们生成一段商业广告片,快速展示产品的能力。结合语音模型,H3 还让声音、画面与角色动作更好地对齐。就像这瓶精华液的广告,H3 自动加上水滴的营销,以及对应的定格音效。

有新的需求,也可以直接编辑

会做第一版,和会改第二版,是两种难度。

广告团队可能并不缺少创意,利用 H3 的 AI 原生后期和复杂文本支持,大多数时候就能把创意变成一个成品。但如果客户或者我们自己的脑海里突然提出了一个微调需求,像是「把女主角 A 换成 B」、「把背景从室内换到室外」,模型要能让我们在 PS 里一样进行精准微操,才是真正的难处。

在 Artificial Analysis 的全球视频编辑榜上,MiniMax H3 一发布就超过了之前的 Gemini Omni 等视频编辑模型,拿下榜单第一。

我们找到了之前 Gemini Omni 发布时使用的小提琴案例,小提琴家在音乐厅表演的视频,可以直接让 H3 修改成在草原和海边。身体的光影,人物的表情,镜头的视角,H3 都做到了完美复刻,只执行了对背景的精准修改。

更有意思的是,我们让它把手中的小提琴换成了二胡,甚至消失不见,然后让这位小提琴手弹空气提琴。

在完全保留原视频人物动作骨架和镜头运镜的前提下,单个物体替换的能力,H3 可以将视频中的物体无缝替换为指定参考图中的对象。

在复杂的双人或多主体画面中,H3 还展现出了空间理解能力。我们可以指定「左边的人根据参考图换一套衣服」,同时「右边的人根据参考图变成一条狗」。

例如我们将前面生成的沙漠公路包包广告,把汽车替换成别的颜色,把女主角替换成一个年轻的女孩。

在传统工作流里,这需要繁琐的抠像遮罩与物体绑定,而 H3 能够在同一个画面里分别处理不同对象的指令。

精准编辑的能力还体现在当我们输入提示词「将摄像机角度调整为从小提琴手的肩膀上方拍摄。」时,H3 依旧能保持人物的耳环、衣服、背景环境一致,仅做到对镜头角度的修改。

全模态精准控制很好地弥补了大多数视频生成「无法定点修改」的空白。当甲方提个需求说这个 Demo 替换成 XX,现在交给 H3 就可以编辑好。

另一条视频赛道

讨论 AI 视频时,我们总是在乎哪个视频模型画质最好,哪个模型电影感最强。

但真正开始做视频之后,会发现还有一件更重要的事。七张产品截图能不能被整理成一支介绍片;一段文字能不能变成包含 Logo、UI、转场和配乐的品牌片;第一版出来以后,背景、道具和镜头角度还能不能继续修改。

相比单个镜头有多漂亮,这些问题更直接决定了一条视频能否被拿去讨论和使用。

MiniMax H3 给我们的感觉,就是解决这些问题的一款模型。

它未必能完全生成那些没有 AI 味的视频,但它几乎把过去散落在视频生成、后期包装、字幕、动效和局部修改里的工作,全部重新放回了同一个模型里。经过测试后,我们对 H3 形成的观感是:它不一定每次都能给你惊喜,但它每次交付都让你放心。

对于广告、电商、游戏或者产品团队来说,这意味着第一次可以先用一套很低的成本,把创意快速做出来;确认方向以后,再决定要不要继续投入更高规格的制作。

更重要的是,当 AI 视频开始真正进入商业生产,模型之间竞争的重点也开始发生变化。

过去一段时间,AI 视频模型不断刷新画质、运镜和电影感的上限,MiniMax H3 展现出的另一种方向则是继续把创意生成、精准编辑、包装和修改做得更完整,让模型更接近真正能够交付内容的生产工具。

或许,这就是 AI 视频发展的另一条赛道:比起一味追逐更便宜、更夸张的生成效果,持续把模型能力打磨得更完整,精进技术,并且将其开源,从而让更多团队真正把 AI 视频用进日常工作流。

长期稳定生成 AI 视频的内容团队,他们更关心整个生产流程是否足够稳定、技术是否能持续迭代,以及模型能力可以无缝容易自己的工作流。

当一款具备完整商业能力的「Seedance 级别」视频模型开源出来,它带来的价值,是让这些团队第一次有机会围绕模型搭建属于自己的视频生产能力,而非依赖高价 Token 采购,被绑定在持续的高成本、高杠杆飞轮上狂奔。

这些视频内容团队,现在也可以按照自己的节奏来搭建算力,实现工作流和业务逻辑的试错与调整,最终走上更可持续、更自主可控的道路。

这才是模型开源这件事,最好的结果。

* 文章内视频可前往 APPSO 微信公众号查看,点击链接

https://mp.weixin.qq.com/s/1X0i3EfI4iweeAMMJ8O6JA*

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 效果 google 奥斯卡 开源
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论