量子位 19小时前
具身明星企业们:别卷模型了,数据才是行业最终的爆点
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

文婷 发自 凹非寺 量子位 | 公众号 QbitAI

真没想到,在大家都忙着卷参数、卷架构、卷硬件的时候,具身智能行业头部的这几位玩家竟然集体调转了方向盘,将矛头直接指向了 " 数据 "!

在刚刚开幕的 WRC 物理 AI 引领者论坛上,清华大学计算机系副研究员苏航、香港中文大学(深圳)- 深圳河套学院双聘助理教授兼跨维智能科学家刘桂良、地瓜机器人算法副总裁隋伟、临界点 CTO 熊坤以及智在无界技术合伙人郑思鹏等行业大佬们达成了一个共识:

具身智能行业真正的引爆点,可能不在于某个模型的横空出世,而是行业终于跑通了一套能持续生产、回收和复用高质量数据的体系。

精彩,实在是太精彩了!

我火速把这场论坛的重点内容梳理了出来,速看!

如果机器人每完成一个项目,下次都要从头再来,那么无论项目数量增长多少,获取下一项能力的成本都不会真正下降,自然也就谈不上规模经济。

模型决定上限,数据决定能不能抵达上限。

仿真的价值不只是 " 便宜 ",更重要的是,仿真数据可以编辑、回收和二次利用,而真机数据往往很难做到这一点。

基础模型仍是目前具身智能行业最核心的变量,且闭环数据正在发挥着越来越重要的作用。

灵巧手未来可能会走向 " 直驱 " 路线,客户已经开始要求它们真的能实打实地干活。

家庭环境于具身智能行业而言,可能更像是终局,而不是起点。

机器人不能永远靠 " 复制项目 " 长大

跨维智能创始人兼 CEO 贾奎在演讲中,先抛出了一个直击行业痛点的问题:

如果机器人每进入一个新场景、学习一项新技能或适配一种新本体,都要重新投入近似相同的资源,这种增长还能叫规模化吗?

△跨维智能创始人兼 CEO 贾奎

答案显然是否定的:

我觉得这更像是在不断复制项目,而不是沉淀机器人的能力。 如果机器人每完成一个项目,下次都要从头再来,那么无论项目数量增长多少,获取下一项能力的成本都不会真正下降,自然也就谈不上规模经济。

贾奎提出,电力行业有千瓦时,云计算有 GPU-hour,大模型有 Token,物理世界同样需要一种更贴近真实任务的计量方式,才能回答 " 生产一项机器人能力,究竟花了多少人力、数据和算力?"、" 不同技术路线,谁的效率更高?" 等一系列现实问题。

于是,跨维智能提出了 Physical Token。

那么,怎样才能持续降低机器人学习新能力的成本呢?贾奎把路径概括为一个公式,即:

人类经验 × 合成杠杆 × 能力聚合 × 飞轮扩张 = 新能力获取边际成本持续下降

具体而言,就是四步走:

第一,把一次示教变成可以反复使用的经验资产

贾奎认为,真人示教、真机遥操作和仿真数据来源不同、形态各异。如果能把它们纳入统一的时空和动作体系,一次学习就不必只服务一个项目,而有机会沉淀为跨任务、跨本体复用的能力。

第二,用少量真实数据撬动大量合成数据

贾奎强调,真实数据不可替代,但不是所有训练经验都必须靠昂贵的真机试错获得。

让少量真实数据发挥 " 杠杆 " 作用,再用仿真扩展数据规模,是降低成本的一条关键路径。

第三,利用通才基模搭出一条可复制的 " 能力生产线 "

贾奎表示,通才基模已经具备一定的空间理解、物体语义和操作先验,再结合后训练、强化学习等方法,就能针对工业、商业、物流和医疗等具体任务进行定向训练;

这样做的目标,就是搭出一条可复制的 " 能力生产线 ",用仿真数据和自动化训练流程快速完成任务适配。

第四,让部署出去的机器人反过来 " 喂养 " 模型

贾奎提出,模型在真实任务中产生的新数据持续回流,既能用于迭代基础模型,也能成为开发下一项能力的原料。

机器人部署得越多,获得的有效经验越多;经验越多,新能力的生产成本越低。

这才是行业真正想要的数据飞轮。

模型决定上限,数据决定能不能抵达上限

强调数据,并不意味着模型不再重要。

相反,多位嘉宾都认为,VLA、世界模型和基础模型仍然决定着机器人能力的天花板。

只是现阶段,模型能力和真实表现之间还隔着一条很深的沟。

智象未来创始人兼 CEO、加拿大工程院外籍院士梅涛表示:

原生世界模型是必经之路。AI 大模型的智能水平已经进入 " 人类天才区 ",但高 IQ 并不等于机器人能在物理世界里把事情做好。

△智象未来创始人兼 CEO、加拿大工程院外籍院士 梅涛

他认为,中国大模型正在探索一条更强调性价比的路线,即用更低的成本,逼近更前沿的世界建模能力。

大晓机器人董事长、商汤科技联合创始人王晓刚则强调,VLA 向世界模型演进非常重要。

△大晓机器人董事长、商汤科技联合创始人 王晓刚

机器人必须遵循具身智能的第一性原理,高密度地锚定控制状态,才能在充满不确定性的真实世界中尽量降低行动代价。

且模型的空间理解能力,至少要体现在三个层面,即:

1、能准确识别空间关系;

2、可完成长程任务规划;

3、可理解并追溯每一步任务状态。

王晓刚认为,如果这些能力最终能够进入家庭,机器人才能真正帮人收拾杂物、处理家务;这也正是大晓机器人 & 商汤科技正在探索的方向。

但王晓刚也坦言,要想真正走到这一步,行业还需要共同努力积累起一个千万级别的真实数据集。

清华大学计算机系副研究员苏航的判断则更直接:

我认为,基础模型仍是目前具身智能行业最核心的变量,且闭环数据正在发挥着越来越重要的作用。

△清华大学计算机系副研究员 苏航

在他看来,要真正建成具身基座,至少还有三座大山需要翻越:

1、具身数据不足;

2、被动模仿学习容易触及上限;

3、真实环境始终处于变化之中。

对此,他给出了三种解题思路(感兴趣的小伙伴们可以去深入研究一下相关论文):

第一,让机器人在没有明确奖励的环境里自主探索

苏航表示,这样做的好处在于,通过无监督学习,机器人可以在在线互动中积累具身感知和与具体任务无关的通用知识,再结合跨本体预训练和策略微调,发现更多可迁移技能。

第二,不只学习 " 成功示范 ",还要学习 " 如何从失败中恢复 "

苏航认为,机器人系统应学会自动保存纠错过程,并及时剔除已经失去价值了的失败路径,并把人工接管后的恢复过程当作高价值监督信号。

这样,机器人才能做得更安全、更稳定,也越来越少需要人工干预。

第三,让能力和经验形成自增强闭环

苏航强调,示范数据与恢复数据应各司其职:前者让机器人知道 " 该怎么做 ",后者则教它 " 做错了怎么补救 "。

机器人能力越强,执行中积累的高价值经验就越丰富;而这些经验回流训练,又会反哺其能力进阶,形成持续增强的正向循环。

这也解释了为什么论坛嘉宾没有把 VLA 和世界模型看成非此即彼的路线。

化用苏航的观点就是:

二者各有优势,真正的选择仍取决于具体的任务和场景。

但无论选择哪种架构,一个判断都越来越清晰:

数据质量比单纯的数据数量更重要,尤其是失败轨迹、人工调试和接管恢复数据,可能比大量 " 完美示范 " 更有价值。

每一次部署能否为下一次部署带来增长效益,正逐渐成为检验具身智能系统是否具备可持续性的关键标尺。

真机数据太贵,仿真正在从替补走向主力

既然数据如此重要,行业下一个问题自然是:数据从哪里来?

真机采集最接近现实,却始终绕不开效率低、成本高、场景有限的问题;

而想让具身模型的训练数据量在短期内快速追上 LLM,也不怎么现实。

于是,仿真数据被推到了聚光灯下。

港中文大学(深圳)- 深圳河套学院双聘助理教授、跨维智能科学家刘桂良提出: " 可以尝试把视频生成模型的泛化能力迁移到 LLM 和 WAM 中,并利用仿真合成数据,缓解真机数据长期匮乏的问题。"

△港中文大学(深圳)- 深圳河套学院双聘助理教授、跨维智能科学家 刘桂良

在他看来,仿真的价值不只是 " 便宜 ",更重要的是,仿真数据可以编辑、回收和二次利用,而已经采集了的真机数据往往很难做到这一点。

例如,同一段仿真轨迹可以调整物体、光照、材质、任务条件乃至失败方式,由此衍生出更多训练样本。

刘桂良指出:

让少量真实数据负责校准世界,同时让大量合成数据负责扩展经验边界,可能是当下更现实的数据路径。

此外,刘桂良还特别提到,数据开源和持续迭代非常重要:

因为只有数据能够被外界验证、不断更新,才有可能形成真正的行业影响力。

对此,地瓜机器人的算法副总裁隋伟,则从自动驾驶迁移到机器人的经验出发,给出了更具体的建议:

我认为,遥操作数据是最直接有效的数据;它的采集效率不高,采集难度和成本也大,但训练效率很高,可以直接用于端到端训练。 与此同时,仿真数据在自动驾驶领域已经体现出巨大价值,这套方法同样值得机器人行业借鉴。

△地瓜机器人的算法副总裁 隋伟

他也认为,相比只收集成功样本,快速收集失败数据、提高数据闭环的迭代速度更加重要。

因为从实验室进入真实场景之后,机器人不仅要 " 会做 ",还要在边缘设备有限的算力下稳定地做。

模型在云端 " 烧 Token" 已经让人心疼,到了边缘侧,算力、内存和功耗的约束只会更加严苛,而这些恰恰也是现在客户验收时非常看重的指标。

因此,芯片能力、操作灵巧度和内存优化,仍然是地瓜机器人目前关注的技术重点。

隋伟的整体判断很谨慎:

我觉得行业整体仍处于一个非常初级的阶段,拐点尚未出现,可能还需要持续深耕个 1-2 年才能解决 " 数据 " 这个制约发展的关键瓶颈。

不过,这也意味着,机会还没有被大厂垄断。

隋伟提出:

OpenAI 等巨头是很有钱,但具身智能的算法和路径同样没有完全跑通。 所以纯从技术角度来看,创业公司依然有机会在拐点到来前抢占属于自己的位置。

最难采的,可能也是最值钱的数据

数据瓶颈在灵巧手领域表现得更加明显。

临界点 CTO 熊坤认为:

灵巧手未来可能会走向 " 直驱 " 路线,但不论硬件路线如何选择,高质量数据都对采集装备提出了很高要求。

△临界点 CTO 熊坤

他指出,视觉可以记录物体在哪里、手指怎样移动,却很难完整还原人类操作时真正依赖的触觉信息,比如温度、压力、材质、摩擦力,甚至物体即将滑落前的细微变化等等:

想让机器人拥有接近人类的操作能力,就需要采集更加丰富的多模态触觉数据。而这恰恰是今天最难、也最昂贵的数据之一。 与此同时,客户的需求也正在发生变化。以前,机器人只要摆着好看、能干点轻活就行;而现在,客户会要求它们能真刀真枪地下车间、进门店,实打实地干活。 等灵巧手真的上了生产线,售后靠不靠谱、服务跟不跟得上,就成了客户挑厂家的一项重要指标。

熊坤认为,目前的硬件和数据都还有很大的发展空间,具身智能的 "GPT 时刻 " 可能不会马上到来。

面对大厂可能带来的威胁,熊坤觉得,通过组织产业生态联盟,形成一道抵御外部冲击的协同防线,或许是一个不错的策略。

智在无界的技术合伙人郑思鹏则把目光投向了另一座数据富矿——人类视频。

△智在无界技术合伙人 郑思鹏

他认为,人类积累的视频中藏着大量关于物体、空间、动作和因果关系的 3D 知识,如果能够把这些信息提炼出来,就有机会提高模型的能力上限。

在郑思鹏看来,现阶段选择哪种架构,主要解决的是模型上限问题;要打造专属基础模型,仍需 1 至 2 年积累数据,而真正走向大规模应用,可能还要更久。

他的建议很有创业时代的味道:

我觉得我们应该尽早组织起一支 20-30 人的小型预训练团队,这支队伍越早建立起来,未来就越有底气和大厂抗衡。 大厂资源确实很多,但想要真正组织起一支高效且方向一致的队伍同样需要时间。 所以说,现在还有属于我们各位的窗口期,只是我们得尽早把数据和训练体系跑起来了。

具身智能的 "GPT 时刻 ",究竟是什么时刻?

这场论坛最有意思的地方,是嘉宾们对 "GPT 时刻 " 给出了不同定义,却都把答案落在了同一条主线上。

有人认为,它是机器人真正拥有随机应变能力、在陌生环境中也能完成任务的时刻;有人认为,它要等到预训练基础模型成熟以后;也有人把标准定得更直接——当行业不再为数据发愁,并由此出现智能涌现时,拐点才算真正到来。

时间判断大多集中在未来 1 至 3 年,没有人认为它会明天突然降临。

现阶段,行业最需要解决的并不是路线之争,而是三件更基础的事:

1、建立高质量数据的采集、评价和泛化规范; 2、让真实数据、仿真数据、人类视频和失败轨迹能够协同工作; 3、让部署数据持续回流,使每一次落地都为下一次落地创造复利。

只有当这套闭环真正转起来,模型的上限才可能转化为产品的下限。

至于最早赚钱的场景,嘉宾们也给出了一些颇为务实的判断。

刘桂良认为,酒店可能是机器人较早落地的场景之一,因为酒店的环境相对可控,机器人与人能够保持一定距离,同时酒店本身也确实存在着搬运、配送、清洁等实际需求。

苏航则认为,从更长远的角度看,非结构化的 To C 场景或许才是具身智能最大的蓝海。

而家庭环境,于具身智能行业而言,可能更像终局,而不是起点;

因为它足够复杂、足够随机,对泛化能力的要求也最高。

One More Thing

说实话,逛完一遍 WRC,我最大的感受可以用 " 惊喜 " 两个字来概括;

不管是可以冲进火灾现场救人的机器人界半人马 " 喀戎 "、能在 1 分钟内完成接单、咖啡研磨、甜度调配、定制拉花和打包全流程的咖啡机器人,还是身着制服、冷静巡逻的 " 机器人警察 " …

它们都在跳出 " 只会跳舞、捡东西 " 的炫技式展示,真正走向更实用的现实场景。

比如,负责设计 " 喀戎 " 的技术负责人告诉我,他们设计这款机器人的初衷,就是希望由消防员操控,让机器人替他们冲进生死难料的火场,无需他们以血肉之躯直面烈焰 :

我很感谢,也由衷地钦佩每一位烈火英雄付出; 但我真心希望,这个世界可以少一些被烈火吞噬的英雄,多一个平安回家的子女、伴侣或父母,所以我设计了它。

这或许也是具身智能真正值得期待的一层原因吧——让人不必再亲自去做那些需要付出生命代价的危险工作。

Anyway,最后来个无奖竞猜~

你觉得图片里这个漂亮小姐姐,是真人吗?

哈哈哈,请在评论区分享你的答案吧!稍后揭晓

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人 ceo 深圳 物理 创始人
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论