每日经济新闻 08-05
京东开源自研JoyAI-Video-Edit模型,字节、MiniMax争相亮剑,视频模型“暗战”正酣
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

随着视频创作告别 " 先拍完再剪辑 " 的线性流程,视频模型 " 暗战 " 也来到高潮。

8 月 5 日,京东宣布,开源自研的实时流式视频编辑模型—— JoyAI-Video-Edit,用户在观看视频的同时,可实时修改人物形象、替换场景、调整画面风格。这相当于给视频装上了一块 " 实时编辑面板 ",过去需要等待整段渲染才能看到效果的操作,如今在播放过程中就能完成。

同日,字节跳动(以下简称字节)也亮出 " 新武器 ",正式推出原生音视频全双工大模型—— SeedRealtime,采用统一架构原生融合音频、视频与文本,在连续的多模态信息流上实现实时交互,主打 " 边看、边听、边说 "。

而在此前的 7 月 31 日,MiniMax 发布新一代多模态生成模型 H3,支持文本、图片、音频和视频等多种输入形式,支持 2K 分辨率直出,可生成最长 15 秒的音画内容;字节也在同一天迭代 Seedance 2.5,可单次生成 30 秒视频片段。快手可灵、阿里通义万相、腾讯混元视频等模型近来也动作频频。

《每日经济新闻》记者注意到,视频模型技术逻辑和市场格局已在改写,最终哪家能胜出,成为市场关注的焦点。

视频创作告别 " 抽卡 "?

通常来说,视频由一帧帧连续画面构成。传统视频生成模型处理的是 " 离线任务 ",换言之,就是用户输入指令,模型花几十秒甚至几分钟生成一段视频,才能看到结果。如果对某个细节不满意,只能重新输入指令、重新等待。生成式人工智能中输出结果的随机性采样过程,被称为 " 抽卡 "。 

《每日经济新闻》记者注意到,JoyAI-Video-Edit 试图打破这个流程,该模型支持任意时长的稳定流式编辑,即视频可以持续播放,模型可以持续处理,不必等待整段生成完成。这意味着视频创作从 " 一次性抽卡 " 变成了 " 可微调的橡皮泥 "。

比如,服装展示视频可以实时更换人物穿搭和背景,家装设计可以一边播放一边切换家具、墙面和灯光效果。影视创作者则可以更快尝试不同的人物造型、场景和视觉效果,减少重复拍摄与整段返工。

技术路径上,记者还了解到,JoyAI-Video-Edit 是一个 160 亿参数的自回归扩散框架,由多模态大语言模型条件编码器和多模态扩散 Transformer(Transformer 模型架构是一种深度学习模型)组成。不过,实时流式编辑的技术难点并不只在 " 快 "。

此前,京东探索研究院副院长段楠在接受《每日经济新闻》记者采访时指出,视频生成模型不仅是 AI 视觉内容的生产工具,更是对物理世界的模拟和数据合成的模型。

视频编辑能力不只是内容生产工具,而是通往 " 物理 AI" 的基础设施。这或许也是京东开源的战略意图所在。

段楠还将京东的 AI 战略划分为三个递进阶段:数字智能,基于互联网数据构建语言、代码、多模态理解生成模型;附身智能,将 AI 能力赋能到电脑、手机、可穿戴设备、智能座舱等设备,强调实时多模态交互;具身智能,将模型扩展到机器人等硬件,让机器能够感知物理空间、建模物理规律、在真实环境中执行操作。

JoyAI-Video-Edit 处于第二和第三阶段的交叉点上。段楠告诉记者,流式视频编辑模型不仅是视频生成领域一个重要的方向,也会对附身智能视频实时交互的需求以及具身智能中数据合成的需求,提供非常基础的能力。

据记者了解,这种战略布局也体现在京东的模型矩阵中。今年上半年,京东还发布了图像空间编辑模型 JoyAI-Image-Edit、多模态实时交互模型 JoyAI-VL-Interaction、长视频生成模型 JoyAI-Echo,以及强调高情商表达的实时语音交互模型 JoyAI-Talker。

段楠还透露,2026 年下半年,京东将在多模态理解和视频世界模型两个方向推出旗舰模型。

视频模型价值评判标准被重写

如果把视线拉回整个行业,京东的模型矩阵布局以及新模型的开源,只是今年视频模型竞逐的一个切片。2026 年上半年,视频生成模型比拼的主旋律是 " 时长竞赛 "。字节 Seedance 2.5 将单段视频从 15 秒拉到 30 秒;MiniMax H3 支持最长 15 秒的音画内容;快手可灵、阿里通义万相也在此迭代。

如今,战局与各家的战略意图明显分化。视频生成模型的竞争维度,正在从 " 生成能力 " 转向 " 控制能力 "。

从 " 能不能生成一段好看的视频 " 到 " 生成出来的东西能不能被持续修改、实时控制、灵活复用 "。从一次性输出到可交互编辑,从离线生成到流式处理。这也是视频模型从 " 玩具 " 走向 " 工具 " 的必经之路。

对此,段楠在接受《每日经济新闻》记者采访时有一个概括性的判断:进入 2026 年,出现了两个显著的变化趋势,一是各家在关注模型智力水平的基础之上,更关心模型能不能真正干活,以及如何把基础模型落地到日常工作流或生活场景中;二是具身智能和物理 AI 的关注度急剧上升,视频模型不再仅仅是内容创作工具,更被赋予了 " 对物理世界建模 " 和 " 为数据合成提供能力 " 的期待。

视频模型的价值评判标准正在被重写。" 能生成 " 只是入场券," 能被控制 " 才是核心竞争力。在这个市场风向中,谁更占据优势?

日前,IDC 中国研究总监卢言霞在接受《每日经济新闻》记者邮件采访时表示," 我想在这个领域,应该还是互联网公司的优势会更大,决胜因素是算力、数据和人才。具备这三要素的更多还是互联网公司。所以中短期的话,可能还是字节、快手等 " 。

而随着视频模型 " 工具性 " 转变的一面逐渐显露在牌桌上,这场竞争或许也越来越接近各个玩家亮底牌的时刻了。

每日经济新闻

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

京东 字节跳动 腾讯 深度学习
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论