GPU 焦虑背后,具身智能行业藏着一道更深的坎
行业观察 · 2026年7月
算力好歹有个盼头,数据才是真无底洞
这阵子聊 AI,三句话离不开算力。H100 交期排到几个月以后,黄牛价翻着跟头往上蹿,创业公司还没融到资先得盘算能不能抢到卡。但这股焦虑放到具身智能的语境下,反而显得有些奢侈了。
怎么讲?因为算力再缺,好歹产能爬坡有迹可循。台积电那边的 CoWoS 封装线,月产出从 2023 年的 1.4 万片 wafer 一路拉到 2025 年的 7 万片,明年摸到 13 万片也不是问题。扩产就是扩产,时间表摆在那。
可具身智能缺的不是算力,而是另一种更根本的东西——人与物理世界交互的真实数据。做一套能应付各种场景的具身模型,需要几千万甚至上亿小时的操作记录。全球搜罗一圈,2026 年这会儿能用的高质量物理交互数据加一块也就 50 万小时上下。缺口大到什么程度?99% 以上。这不是差了一点半点,是差了整整两个数量级。
为什么差这么多?问题的根子在三个地方。
头一个,数据没法从网上扒。大语言模型有整个互联网当粮仓——GPT-3 那 45TB 的训练数据,全是从网页、书籍、论文里扫下来的。轮到机器人就不灵了——它要理解的是物理世界,不是文字世界。比方说拧个瓶盖,咱们凭手感就知道用多大力、往哪个方向转,可背后涉及瓶盖材质、螺纹摩擦力、手腕角度,这些变量互联网上一条记录都没有。
第二道坎,质量要求极其苛刻。大模型训练吃点脏数据问题不大——文本里掺几句错别字,模型照样能从上下文里学会正确用法。但机器人那边可不行。采集数据的时候,摄像头帧率抖一下、关节编码器延迟几毫秒、力传感器的读数飘了,这些东西不像错别字那么好修。鹿明机器人的一位技术负责人说过,市面上不少采集设备本身的硬件就不达标,画面跟动作对不齐,采出来的数据连送进训练管线的资格都没有。花了力气不说,弄不好还把模型给带偏了。
第三,数据跟硬件绑得太死。GPU 这边,从 A100 换到 H100,训练脚本几乎不用动,算力直接翻倍。机器人这边呢?一台 1 米 6 高的机器人和一台 1 米 8 高的,同样是弯腰捡东西,重心偏移、关节转角完全两码事。前者跑出来的数据,后者根本用不了。各家机器人参数不一样、场景不一样,数据天然就是一座座孤岛。
算力是标准化的——工艺进步了,产能上来了,成本自然往下走。数据却是非标的,跟每一台机器、每一个场景深度绑定。从这个角度说,算力荒是个短期阵痛,数据荒才是埋在深处的结构性问题。
三条路,各有各的别扭
面对这个局面,行业内目前有几种主流打法,每种路子都有它的取舍。
第一种,用真机一点一点攒。就是让操作员穿戴动捕设备或者 VR 头显,远程操纵机器人做动作,逐条把操作数据录下来。好处是数据质量没得挑,录出来的直接就能用。但成本也吓人——北京人形机器人创新中心搞了个将近 5000 平的采集场地,120 台机器人同时在跑,光硬件和场地就砸进去几千万。智元那边更夸张,部署了大约 200 台机器人,几百个采集员三班倒。这种路子好比手工雕花,活儿是好活儿,就是太慢太贵,想靠它撑起上亿级别的数据底座,账面上算不过来。
第二种,把采集设备从机器人身上拆下来。这就是所谓的 UMI 方案。操作员拿一个轻便的夹爪加摄像头,在真实环境里做动作,边干边采。大衍科技跟无人超市合作,让店员戴着采集设备正常上班,干一天活顺便就把数据收了。成本比真机方案低了一大截,速度也快了不少。不过问题在于,人手操作没法保证每次的摄像头角度和夹爪姿势都一样,采回来的数据格式参差不齐。上海交大一个研究团队指出,大规模采集之后,大量参差不齐的数据需要人工筛选对齐,后处理成本一上去,综合算下来未必便宜。
第三种,干脆不用真机,在仿真环境里批量生成。跨维智能的 EmbodiChain 工具链全程用合成数据训练模型,最后直接部署到真机上,跑通了虚实迁移的链路。诺基亚跟英伟达合作,借助 Isaac 仿真平台把训练效率提高了将近 10 倍。但这套方案的软肋也很明显——仿真再逼真也不是真实世界。斯坦福今年的《AI Index Report》提供了一个数据:模型在仿真环境里完成任务的成功率能达到 89.4%,一到真人家里的场景就掉到了 12.4%。实验室里的优等生,进了考场就不太会做题了。
眼下三条路都在跑,也都有各自的应用场景——真机扛着精度天花板,UMI 拼规模化效率,仿真用来覆盖那些真机不好跑的极端情况。要说谁能最终突围,目前还没定论。
谁都想要数据,谁都不想给
绕来绕去,其实所有方案都卡在同一个矛盾上:数据这个东西,规模、质量、成本,三样没法同时满足。
按理说,最好的解法是全行业把数据凑一块。共享了,每家都不用重复造轮子,成本摊薄了,数据量也上去了。这个方向上已经有人探路了——乐聚牵头,联合宇树、阿里云这些玩家,建了个国家级开源数据社区 OpenLET,放了超过 6 万分钟的真机数据集出来。均普智能今年 6 月也开源了一个面向强化学习的大规模数据集。
但坦白讲,开源这件事在这个行业里还是少数派。更多的公司选择了另一条路——把数据当商品卖。京东把数据采集做成了一个独立业务,计划发动最多 60 万人参与,两年攒 1000 万小时的视频数据,还上线了一个专门的交易平台。箸境智能在江苏省数据交易所完成了国内首笔具身智能数据集交易,涵盖办公、商超、餐饮、家政四个场景。鹿明机器人搞了个「数据超市」,客户可以在线按需采购。
道理大家都懂——数据共享对全行业有利。但在商言商,我先开源了,对手拿着我的成果低成本超车,我图什么?星海图的 CEO 高继扬说得直白,现在行业对数据的私有属性看得很重。每个人都护着自己的盘子,结果就是全行业都在重复采集,整体效率并不高。这局面的本质就是博弈论里的囚徒困境——除非有人能力推一套行业标准和利益分配机制出来,否则「共享共赢」多半只能停留在 PPT 上。
与其等人喂,不如自己找食吃
回到根子上来想,如果行业注定要各走各的路,那最有希望的方向是什么?大模型那边的发展历程或许能给点启发。
英伟达的 Eureka 系统做了一件事:让 AI 自己生成多种解决方案,自己去比较、筛选、改进——有点像程序员对着自己的代码做 code review。结果是 Eureka 在 83% 的任务上超过了人类专家。Kimi K2 也是类似的路数,让智能体在一个模拟器里反复练习,通过持续试错自己积累经验。
这两套方案有一个共同的内核:智能体不再等着人类给它喂数据,而是在跟环境的互动中自己产生训练信号。把这个逻辑移植到具身智能上,思路就打开了——重点也许不是堆数据量,而是把数据流动的回路跑通。
上海创智学院和智元联合搞的 LWD 系统,就是冲着这个方向去的。机器人干活的时候,不管是成功操作、中途出错后自己纠正的轨迹,还是人类手把手引导的失败案例,全部录下来、回传、微调模型。这套机制跑下来,单一通用策略在长程复杂任务里的平均成功率做到了 0.95,远高于传统行为克隆的 0.76 和离线强化学习的 0.86。
这么一想,场景其实挺有意思的。假设一台机器人在拧瓶盖的时候碰上了滑丝的盖子,它调整了一下扭矩,成功了。这个「意外经验」被记下来,传回去,模型更新之后再推送给所有机器人——于是每一台都学会了处理滑丝的情况。每个机器人碰到的特殊情况,都能变成整个机群的共同经验。当这个闭环真的转起来,机器人就不再需要人类手把手地教了,它在真实世界里自己就能进化。
算力有钱就能买到,但物理世界的经验没人替你攒。这场长跑,最后比的恐怕不是谁的 GPU 多,而是谁能让机器人更懂这个真实的世界。
本文基于行业公开信息整理,内容仅供参考。
发表评论 取消回复