极客电影 昨天
vivago R1一次对话生成5分钟,AI视频迎来“单反”时刻?|实测
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

3 个月融资 21 亿

这家 AI 独角兽瞄准 AI 长视频编排能力

文 | 子路

编辑 | 佛耶戈

欢迎在小宇宙 APP 订阅:FoST 未来叙事

收听我们出品的播客节目《AI 超创快上车!》

上周末最大的新闻看了吗?ChatGPT-6 Astra 上线,意味着AGI 时代(AI 专业度优于人类)可能真的要来了。

很巧,今天我去海淀参加了一场特别有趣的 WorkShop 分享活动。近三个月内融资超 21 亿元的智象(HiDream.ai),宣布旗下 Agent 产品vivago R1(国内版够搭)全球正式上线,他们根植于 AI 长视频编排应用场景,提出了一个新锐观点:

请相信这个 Agent 平台的专业能力,它是行业首个通过一次自然语言对话,就能稳定生成 5 分钟 " 单反级交付 "AI 视频的产品

AI 视频创作的 AGI 时代,先从智象未来开始了?

这家 AI 独角兽公司以自研多模态模型起家,是业内著名" 学霸 ",旗下模型频频登上国际权威评测榜单前列,在多项基准测试中刷新 SOTA 纪录:

2026 年 5 月,开源模型 HiDream-O1-Image-Dev-2604 在 AA 榜单中斩获开源模型全球第一

2026 年 6 月,商用版图像生成模型 HiDream-O1-Image-1.5 在 AA 榜单中,超越 Google Nano Banana 2、NVIDIA Cosmos3-Super-Text2Image、字节跳动 Seedream 4.0 等国内外主流模型,位居全球第三、中国第一

" 学霸 " 发布新产品,效果如何?

【FoST 未来叙事】第一时间上手实测,确定 vivago R1 真的做到了具备大众普适性与场景应用价值的 AI 视频创作专业度,你可以相信这个 Agent

1

一次对话

生成 3 分 + 完整汽车广告

在当下 AI 市场上,没有搭载 Skill 的 Agent 平台拿不到大结果。

打开 vivago R1(国内版够搭)官网(https://goudaai.com/)首页,我首先就被它的 SkillHub 吸引了。

不同于多数 Agent 平台用电影名家画风区分 Skill,R1 的技能库更符合 " 技能 " 定义,每一个都导向了具体应用场景,比如服装搭配、叙事广告、装修模板、亚马逊商品详情页等,大部分指向 TVC 视频。

现在市面上大都在讨论 AI 故事片作品,但其实 AI 视频使用最广泛的,正是 TVC 广告片领域。不管是产品元素还是视频片段,AI 与实拍相比都是十倍以上的成本压缩。

所以要用 vivago R1 做测试,尤其是它高亮的 " 一次对话稳定生成 5 分钟长视频 " 能力,我第一反应就是:给我做一个 FoST 品牌的长视频汽车广告出来

点击箭头生成,就会跳转到 R1 画布。左边是整齐排列的图片资产、视频素材,右边是自然语言对话 Agent,随便给它提要求,它都能进一步拆解你的创意、导向成品。

R1 拆解了我的创作意图之后,表示汽车广告一般 1 分半左右,建议我不要做太长,最好是 3 分钟出头;

又经过简单沟通,给我生成了一份一家三口驾驶 FoST 电动汽车、两天一夜自驾游的剧本:让汽车经过城市、盘山公路、草地、碎石浅滩、涉水等路况,展现汽车的多地形性能与长续航能力。

我觉得这个故事覆盖面已经很全了,确认继续制作,它就开始生成画面风格、资产圣经、分镜设计、图片资产等。

值得一提的是,R1 在图片资产设计这块儿很有一套,它帮我完成了从创意激发到资产落地的全过程

比如,它会生成一些十二宫格的铅笔画分镜草图,大致演示一下分镜效果,并且用红粉蓝绿等不同颜色标明对应的动作、表演、运镜、构图等专业信息,简单明了。

在调用图片模型方面也很智能,在我还没有明确想法时,它生成图片强调给角色更松弛的站姿、多种造型、粗糙但真实的皮肤细节,供我选择;

帮助我排除错误答案、确定各种造型应用场景之后,则改为生成更标准的三视图,用于后续视频生成。

视频生成阶段也很稳定,全长 3 分 15 秒的汽车 TVC,角色、汽车、画册等道具都没有崩坏,很好地保持了一致性。

它也支持分镜、视频素材等内容的修改,比如我觉得第六组分镜生成效果节奏慢了、原本确认的想法又有改变,就可以用自然语言要求它忘掉我之前的修改意见,按照新意见再修改,它能分辨并记住我的需求,应用在后续生成里。

这都体现了vivago R1 足够长、足够稳定的上下文理解能力,不需要重复修改、赌命抽卡,你就能得到想要的交付级成品。

测试下来我发现,vivago R1 的核心能力,是长视频编排

以现有 AI 技术,生成视频片段并不难,难的是在保持一致的前提下持续生成叙事连续、逻辑在线的完整长视频。目前市面主流的制作模式,还是 AI 创作者生成零散素材之后剪辑为成片,R1 改变了这种模式,就像它官方介绍的:

它能通过多智能体协同机制,将 " 理解任务→构思故事线→创作分镜脚本→生成核心素材→生成超长视频 " 的完整创作链路进行原子化封装与专业化调度,确保叙事、镜头、角色、风格、声音和审美的有机统一,真正实现了从 " 单点工具 " 到 " 全链路创作系统 " 的跨越

而且在这个平台上,你创作的角色、场景和道具都能形成可复用资产,后续镜头围绕同一套资产继续生成,进一步减少长片里常见的人物变化、场景跳变和风格断裂等问题。

所以第二个测试,我们就复用了汽车 TVC 里的角色资产,把这一家三口 " 搬 " 上街头、摄影棚,调用 R1 的 " 叙事广告导演 Skill",制作了一条全新风格的服装 TVC 视频

来看看效果,是不是比某宝的模板视频强多了?

借助 Skill 预设能力,这条 1 分钟视频只做了两个小时

一次对话稳定生成 5 分钟视频,角色、场景等资产复用后继续生成,从这个角度来讲,vivago R1 几乎可以做到无限时长的持续稳定生成

不止 TVC 品类,AI 短剧团队、孵化自有 IP 的 AI 超创们、自媒体达人们等等,都可以来试试这个新上线的 Agent 平台。

2

3 个月融资 21 亿

这家独角兽想做垂直场景

其实早在 7 月份 WAIC 2026 大会现场,智象未来创始人兼 CEO 梅涛就现场首发了这款全球首个无限时长内容创作多模态智能体,vivago R1。

同期,这家公司在3 个月内融资 21 亿元,成功跻身 AI 独角兽行列。很多人都在观望,智象未来到底想往哪个方向发展?

随着多个自研模型、产品的曝光,它的路线愈发明确:模型基座和 Agent 双轮驱动

持续精进的自研模型能力是基础,除了上述全球前列的商用图像生成模型,就在前天,智象自研的具身世界模型 HiDream-O1-Embodied 首次参评具身智能模型评测平台 RoboColiseum,即在核心的 Robustness(扰动适应)子榜单中,以平均分 0.692 的成绩登顶榜首

而落地到具体的应用场景上,则必须导向将基础模型的生成与推理优势转化为标准化、可验证、可交付的系统化产业能力的,Agent 智能体

梅涛院士在 WAIC 2026 大会发言里还给到了一个产品侧进一步落地的畅想:

在复杂的任务和场景中,单智能体存在明显的能力边界,无法独立完成跨链路、高精准的创作任务。唯有通过多智能体集群协作,模拟专业团队分工模式,才能 " 胜任 " 一些复杂的产业难题。

所以,智象自研了全新 HD-AgentOS 智能体操作系统。vivago R1,就是这套多智能体协同核心技术积累下,于视频创作领域最新落地的应用层产品。

这家公司很有趣的点就在这里,创始人是科学家出身,也待过京东等互联网大厂,所以绝对反对 " 纸上谈兵 "。

他既要模型的技术力,又坚持把所有技术力通过智能体产品与用户产生强关联;而所有产品,都必须指向垂直的应用场景,从实操上帮创作者解决问题。

这次上线 vivago R1(国内版够搭),就是 AI 视频场景应用的一次集中展示。

智象把这款产品定位为" 你的 AI 视频创作好搭子 ",在今天的分享会上,来自不同领域的品牌广告导演、AI 创作者、品牌策划等均现场分享了用 vivago R1 创作的多场景 AI 视频 demo,包括香水广告、IP 设计、叙事片等多种类型。

来自海外的多位 OPC 创作者也通过视频分享,vivago R1 帮他们实现了从输入一句话创意,到通过长视频编排来生成完整成片的惊喜。

我对 vivago 系列产品负责人现场分享的一句话印象很深刻:

Token 消耗是摆在每个创作者面前最现实的问题,那么一个能做到稳定生成的 AI 产品,就是在帮创作者省钱

而 vivago R1 致力于通过优化模型调用的长视频编排能力,让 Agent" 想得远、记得住、改得动 ",就是当下乃至未来一段时间内这类 AI 产品的版本答案。

3

把判断交给 Agent

AI 视频迎来 " 单反 " 时刻

为什么我会觉得,智象未来主攻长视频编排能力的 vivago R1 产品,是 AGI 时代前夜的第一束光?首先,我们要厘清一个概念:

长视频编排,绝对不是站在其他生成模型肩膀上的偷懒行为,而是专业可落地的另辟蹊径

1976 年,第一台入门级单反相机 " 佳能 AE-1" 正式问世,彻底改变了摄影的社会属性。就像它那句非常经典的广告语:

So advanced, it's simple(如此先进,如此简单)。

它打破了单反相机操作繁琐的专业壁垒,让每一个不懂光圈、快门等专业参数的普通人都能拿起相机、记录生活,拍摄出不错的照片。

图片由 AI 生成

视频制作也一样。一直以来,人类把脑海里的故事变成可视化的影像,都需要复杂的 " 翻译层 "(编剧、摄影、剪辑等);AI 技术的到来,把翻译简化成了提示词,你给到 AI 专业的语言指令,就能得到大致想要的结果。

提示词仍然是有隐形门槛的,所以在 AI 视频行业诞生这一年里,首先实现经济繁荣的是卖课群体。

而如今 vivago R1 的诞生,砍掉了这层翻译。这意味着人类最擅长的 " 自然语言讲故事 " 能力,直接变成了最复杂的结果:一条可专业交付的完整视频。

放眼当下 AI 视频创作工具市场,产品方向主要分为两种路线。

一条是画布式、节点式工作流:把模型、工具和参数全部摊开,交给用户自己选择、连接和调试。它的优势是自由度高、控制颗粒度细;代价是用户必须理解模型边界、参数含义和组合逻辑。

另一条,是vivago R1 选择的对话式路线:不把复杂流程摊给用户,而是尽可能把中间环节收进 Agent 里。用户只负责表达意图、判断结果;脚本拆解、镜头规划、角色一致性和成片组织等中间层,则由 Agent 在后台完成。

这两条路线背后,是两种不同的产品判断。

前者相信,创作的控制权应该尽可能交给用户;后者则认为,真正降低门槛的方式,是像单反一样用科技整合基础能力,把专业创作者的经验、审美和判断逻辑,编码进 Agent 的长视频编排能力中

模型能力,不等于产品能力。

vivago R1 用足够长、足够稳定、自带深度思考的模型基座与产品能力,大幅降低了大众从自然语言到复杂视频的门槛,把模型的上限变成每个创作者手里真正能用的东西,这就是 AI 视频创作的 " 单反 " 时刻

当 AI 的专业能力优于人类并服务于人类,AGI 时代就真的来了。而现在,至少我们已经在这个新产品上看到了一丝曙光。

Agent 可以帮你做判断,你,只需要一个创意

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 单反 技能 融资 独角兽
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论