子弹财观 前天
从“生成世界”到“理解世界”:昆仑万维升级背后的AGI路线图
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

7 月 19 日 WAIC 期间,昆仑万维以一场 " 世界模型与多模态范式跃迁 " 专场论坛,宣告了一个信号:2026 年,被定义为 " 世界模型元年 "。

这不是一家之言。2024 年,李飞飞创办 World Labs,不到三个月即以 10 亿美元估值将 " 空间智能 " 送入公众视野;2025 年,World Labs 推出首款商用世界模型 Marble 与实时模型 RTFM;2026 年 3 月,OpenAI 关停 Sora 消费级产品,将团队全面转向面向机器人技术的世界模拟研究。

从谷歌 DeepMind 的 Genie 到 Meta 的 JEPA 架构,从英伟达 Cosmos 到国内一批创业公司的跟进," 世界模型 " 正在取代 " 大语言模型 ",成为 AI 产业新的叙事主线。

如果说过去三年,行业的核心命题是 " 让 AI 能说会画 ";那么从此刻起,命题升级为让 AI 理解重力为什么向下,理解一首歌里没说出口的情绪,理解一个杯子坠落时会发生什么。

伴随这一判断,昆仑万维集中发布了 Matrix-Game 3.5 世界模型、Mureka v9.5 与 O3 音乐模型、黎曼动力 Riemann-1.0 具身模型。三大产品从虚拟世界生成到物理世界交互,指向同一个底层逻辑:AI 的竞争不再是 " 谁能生成得更多 ",而是 " 谁能理解得更深 "。

1

AI 核心命题的范式转换

过去两年 AI 行业的核心命题是 " 生成 ",生成文字、图像、视频、音乐。但这些生成的内容,模型自己真的 " 懂 " 吗?

答案是否定的。

大语言模型可以写出 " 苹果从树上掉下来 " 的句子,但它从未 " 理解 " 过重力,因为它从未生活在有重力的世界里。

这正是世界模型要填补的鸿沟。从 2026 年起,AI 的核心命题将从 " 生成 " 转向 " 理解 " 与 " 交互 ":让 AI 真正理解物理世界的运行规律,并能与真实环境进行闭环互动。而世界模型,正是实现这一跨越的关键技术底座。

图 / 昆仑万维董事长兼 CEO 方汉

昆仑万维董事长兼 CEO 方汉在论坛上系统阐述了他的三大产业预判,每一个都在重新定义 AI 能力的边界:

第一,世界模型将走出屏幕,进入物理世界。具身智能正从实验室走向真实环境,这一趋势要求机器人在行动前先进行环境推演,预判动作后果、评估环境变化、及时调整应对策略。

这种能力的突破,将使竞争焦点从单一任务转向陌生环境下的通用模型能力;谁能训练出在复杂场景中依然 " 看得懂、做得对 " 的模型,谁就拿到物理智能时代的入场券,这也是中国智能制造和机器人产业真正亟须的底层能力。

第二,游戏行业将率先被世界模型改变。开放世界游戏不再依赖数百人团队数年的手工搭建,Matrix-Game 3.5 让虚拟世界随玩家行动实时生长、持续演化。未来三到五年,世界模型将成为游戏行业的基础设施,彻底刷新内容生产方式,而国产模型已在这一赛道领跑全球。

第三,AI 音乐、AI 视频等工具将从技术试验变成大众创作工具,促进 AIGC 的深层发展。Mureka 作为中国最强、全球前两名的音乐生成模型,率先去除 "AI 味 ",让普通人也能把模糊灵感转化为有情绪、有温度的作品。

三个预判指向同一个方向,让 AI 从 " 会生成 " 走向 " 懂世界、能行动 "。这也恰好定义了昆仑万维三款新产品各自的使命。

作为昆仑万维世界模型系列的最新迭代,Matrix-Game 3.5 带来了革命性的技术升级。Matrix-Game 3.5 聚焦可交互世界模型技术,实现了 Patch 级别的记忆注入与系统级性能优化,5B 模型在 720p 分辨率下可实现单卡 20FPS 实时生成,具备 1 分钟记忆能力。

图 / Skywork 首席科学家成宇

Skywork 首席科学家成宇指出,世界模型是具身智能的 " 无限数据引擎 "。传统数据采集面临人工成本高昂、实机采集耗时耗力、效率极低的痛点,无法满足大模型规模化需求。

Matrix-Game 3.5 构建了支撑下一代世界模型的无限数据生产体系,突破传统瓶颈,打造三条自动化数据生产管线,输出 Video+Pose+Action+Language 的高质量训练数据,目前已积累超 500 万高质量视频切片、超 1 万有效训练小时数、覆盖 1200 余个游戏场景。

在技术架构上,Matrix-Game 3.5 创新性地将历史帧切分为带有 3D 坐标的 Patch Memory(通过 Depth+Pose Lift 到世界坐标系),推理时根据当前相机视锥检索可见 Patch 并重新投影到当前视角形成 Mosaic,再作为 Memory Token 注入 DiT,实现长期一致性的 Patch 级空间记忆。

这一设计将 Frame-level FOV Memory 升级为 Patch-level FOV Memory,带来四大核心优势:更准确的空间记忆检索与跨帧一致性、更稳定的相机运动生成、最大程度保留基座模型动态生成能力的 In-context Learning,以及用户可自由编辑记忆块的可控记忆能力。

其次,Mureka v9.5&O3 音乐大模型的发布,成为本次论坛最具情感冲击力的时刻之一。

从 SkyMusic 1.0 内测到 Mureka v9.5&O3,昆仑万维的音乐模型走过了一条从 " 作品成立 " 到 " 创作可控 " 再到 " 多模态创作 " 的演进路径。

而 v9.5 版本首次喊出 " 最没有 AI 味的 AI 音乐模型 " 这一口号,它不再依赖声部堆砌和复杂编配制造 " 厉害 " 的第一印象,而是在真实的音乐框架中,以更为克制的方式处理编配、人声、情绪与 Prompt 意图,让音乐表达更自然、更真诚。

O3 建立在新版 V9.5 之上,并通过 test-time scaling 扩展 MusiCoT 的推理过程。它不是简单地 " 生成得更多 " 或 " 想得更久 ",而是让模型在生成过程中持续审视当前表达:局部旋律是否仍服务全曲目标,编配是否遮蔽人声,情绪是否提前透支,结构是否正在偏离最初意图。额外推理空间被用于回看偏差与自我修正,使音乐 CoT 能够逐步收敛,而不是一次决定后一路向前。

图 / 歌曲的主观评分

从评测结果看,V9.5 沿着 MusiCoT 路线完成了更扎实的底座升级:旋律、人声、音质和编曲全面提升,指令精准度从 6.92 提升至 7.62。它不再把 " 更满、更复杂 " 当作唯一标准,而是在真实音乐框架中更克制地处理编配、人声、情绪和 Prompt 意图,让歌曲更自然、更真诚。

O3 则建立在 V9.5 之上,通过持续推演、回看偏差和修正后续决策,进一步强化旋律发展、编曲结构与指令理解,使歌曲结构更完整、情绪更连贯、段落关系更合理。简单来说,V9.5 负责把歌做得更自然,O3 负责让模型在交付前多看、多想、多修一遍。

更为重要的是,Mureka 已从单一的音乐生成工具演进为完整的 " 版本化制作 " 平台。同一创意可快速生成多版本,支持在旋律、人声、结构等维度进行局部保留与替换;Studio 将 " 操作 DAW" 转化为 " 指挥创作 ",降低门槛、抬高上限。

正如昆仑万维所提出的愿景:AI 音乐不再是简单的消费内容,而是升级为一种自我表达的语言。用户不仅是被动聆听者,更是主动表达者与参与者。

最后,黎曼动力机器人近期推出的 Riemann-1.0,是其成立以来首个公开发布的成果,面向 Physical AI 的新一代 Embodied World Action Model。

该模型基于超过 23.2 万小时多源具身交互数据训练,统一融合第一视角人类视频、UMI 示教与异构机器人轨迹,并提出全因果世界动作建模架构与三阶段渐进式具身预训练框架。

Riemann-1.0 不再停留于仿真环境中的离线评估,而是在多个国际主流机器人 Benchmark 与真实机器人任务上同步实现仿真与真机双 SOTA,为机器人操作、实时自适应控制及高频人机协作等 Physical AI 场景提供了从 " 理解世界 " 到 " 干预世界 " 的生成式行动基础设施。

2

产业落地,

直击游戏、影视痛点

技术突破不是终点,产业验证才是。昆仑万维的产品正逐步走向生产线,在影视、游戏、音乐等场景中接受市场的真实检验。

先看影视行业的短剧、AI 漫剧,中国网络视听协会发布的 2026 年第一季度《微短剧创作指引》显示,2026 年一季度全行业上线微短剧约 12.8 万部,其中 AI 生成内容占比超过 95%。DataEye 数据显示,2026 年以来,每月都有超 1 万部 AI 漫剧上线。

爱奇艺高级副总裁杨海涛从平台数据出发,透露爱奇艺后台每日收到超 3000 部 AI 短剧与上千部 AI 漫画,AI 内容观看数据持续提升。他以爱奇艺 " 燎原计划 " 扶持的网络电影《勿念》为例,AI 在电影镜头特效制作方面实现超 50% 的提效,从导演构思到成片可节约三周以上的时间,他预计暑期将上线更多 AI 参与的网络故事片。

但繁荣之下,痛点也随之浮出水面。最突出的两个问题是:画面一致性的缺失与 " 活人感 " 的不足。

大量 AI 生成的短剧作品质量参差不齐、同质化严重。全国范围内能有优质、原创且稳定产出的 AI 影视团队不足百家。有调研数据显示,超过四成用户对 AI 生成配音情感不足感到不满,认为 AI 生成的角色过于扁平。

演员王珞丹分享了自己的 AI 创作体验,为求一个理想镜头,熬夜 " 抽卡 " 到凌晨 4 点,反复调整提示词,直到清晨才终于抽到满意的镜头。

面对影视行业的 " 抽卡 " 等困境,昆仑万维以 SkyReels 系列和全栈 AI 能力给出了系统性解法。

在画面一致性上,SkyReels 已成为行业标杆。2026 年 2 月推出的 SkyReels-V4,在 Artificial Analysis Text-to-Video(With Audio)与 Image to Video(With Audio)两大榜单登顶全球首位,超越 Kling 3.0、Google Veo 3.1、Sora 2 等全球主流模型,支持音画同出、逻辑推理及多帧参考等高阶能力。

青年导演崔睿表示,昆仑万维的 AI 视频模型 SkyReels 在一致性方面非常突出,能有效解决创作者最头疼的 " 抽卡 " 效率问题,在系列化制作中保持人物、物体的稳定统一,避免反复尝试的无效劳动;同时音画同步能力也值得肯定。整体来看,他认为 AI 视频工具值得创作者去尝试和使用。

中国电影家协会副主席黄晓明的体验则展示了技术的快速进化:三个月前看一部 AI 生成的电影,还能明显看出 AI 的表演痕迹;" 但最近再看,细节到脸上的斑点毛孔,甚至微表情、毛孔都在演戏 ",他已经完全分辨不出来了。

此外,全球游戏产业正经历一场结构性阵痛。据 Newzoo 数据,传统 3A 大作的平均开发周期 5 年,成本已飙升至数十亿美元级别:米哈游为打造《原神》投入了 4 年研发周期与每年超 2 亿美元的运营成本,Rockstar 的《GTA6》更是让玩家等待了十二年。

摩根士丹利 2026 年报告测算,生成式 AI 可将 3A 游戏开发成本削减 44%,释放约 220 亿美元增量利润。但现实中,AI 在游戏研发中的落地仍面临核心矛盾:成本、效率与品质的 " 不可能三角 "。

方汉的判断是,开放世界游戏不再需要数百人团队数年手工搭建,Matrix-Game 3.5 让虚拟世界随玩家行动实时演化。Matrix-Game 系列已成为英伟达 SANA-WM、Adobe RELIC 等国际头部大厂世界模型的对比基准,DiT 作者谢赛宁团队基于其 2.0 版本发布了全球首个多人视频世界模型 Solaris。这意味着,在下一代 AI 基础设施的起点上,中国公司与全球巨头站在同一刻度线。

但方汉也坦承推理成本是瓶颈," 不能买一张百万级 H200 只为玩 3D 游戏 ",预计 3 — 5 年内解决。

这一判断与行业趋势高度吻合,根据 ResearchIntelo 预测,随着推理效率提升和硬件成本下降,世界模型在游戏领域的渗透率将在 2028 — 2030 年间进入爆发期。

在 WAIC 论坛上,方汉说了一句话让现场很多人印象深刻:" 我们反对拿着锤子找钉子,主张拿着钉子找锤子。" 这句话概括了昆仑万维的 AGI 路线,即从行业需求倒推技术方案,而不是先造一个模型再找出路。

3

结束语

当前 AI 行业的主流策略是 " 单点极致 ",在文本、图像、视频或音乐的某一垂直方向上做到极致,以技术壁垒构建护城河。而昆仑万维选择了一条不同的路:大模型覆盖语言、图像、音乐、具身等,形成从 " 内容生成 " 到 " 世界理解 " 的全栈能力。

昆仑万维的逻辑是:世界模型天然需要多模态协同。因此,从 2022 年 "All in AGI 与 AIGC" 到 2026 年宣告 " 世界模型元年 ",昆仑万维完成了从全模态内容生成到可交互世界理解的关键跃迁。

当生成能力已不再是稀缺品,理解力的深度,例如对空间、音乐、物理规律的因果建模,将成为 AI 下半场真正的护城河。世界模型元年,只是一个开始。正如方汉所言:" 这不只是一家公司的回答,更是中国 AI 从研发走向产业应用的一个缩影。"

游戏、影视、音乐、机器人的生产方式正在被重新书写,而 2026 年的这一声发令枪,才刚刚响过。

© 投稿专线   微信:cyzqx2013

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

昆仑万维 机器人 谷歌 英伟达 李飞飞
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论