具身智能泛化之战:数据越多未必越聪明,行业正经历一场预期重塑

一场没有标准答案的竞赛

2026年9月的上海,40多家具身智能厂商将机器人推进了真实经营场景。它们取药、组装、折衣服,看起来似乎什么都能干。但所有从业者都知道,"在一个展台完成任务"和"一套模型跑通多个场景",中间隔着一道行业三年来没能跨越的鸿沟。

破壳机器人创始人、清华大学交叉信息研究院助理教授许华哲在上海Inclusion·外滩大会期间面对媒体时,把这道鸿沟浓缩为两个字——泛化。"今年会批量看到真正意义上的泛化,同一个模型在不同地方做一系列任务,"他说,"这一件事情,在过去的三年里面,是没有看到的。"

外滩大会追问具身智能:数据越多越聪明吗?
外滩大会追问具身智能:数据越多越聪明吗?

硬件狂飙与技术冷静

具身智能行业的矛盾,首先体现在数字上。据Smart Analytics Global(SAG)数据显示,2026年上半年全球人形机器人出货约1.91万台,同比增长272%,去年同期仅5100台;中国厂商占比超过97%。工业和商业应用已占出货量的70%以上。

但SAG同时发出警告:机器人硬件放量速度已经快于技术成熟度。真实世界数据、模型能力、可靠性、操作精度、安全和成本,仍在限制更大规模的部署。一台机器人卖出去,能不能在工厂里稳定运行三个月,是另一回事。

外滩大会追问具身智能:数据越多越聪明吗?
外滩大会追问具身智能:数据越多越聪明吗?

百万小时数据的幻觉

过去一年,几十万小时、百万小时的数据集开始频繁出现在具身智能公司的发布通稿里。数据越多,机器人就越聪明吗?许华哲的回答是否定的。

"百万小时比十万小时多一个数量级,很容易比较,但目前并没有看到数据数字越高,模型效果就一定越好。"他直言不讳地指出,按照当前市场价格,一小时数据采集成本可能达数百元,一百万小时的投入可能高达数亿元。如果最终不能有效用于模型训练,代价并不小。许华哲反对的并不是继续扩大数据规模,而是先追求数字、再考虑数据有没有用。他主张"边扩边找,边找边扩"——先确认什么样的数据有效,再继续放量。

外滩大会追问具身智能:数据越多越聪明吗?
外滩大会追问具身智能:数据越多越聪明吗?

仿真与真机:不是二选一

苏度科技联合创始人、CEO韩铮的判断更为细化。他认为具身智能需要的是结构化、多样和高质量的数据,仿真与真机数据并非二选一。部分抓取技能可以主要依靠仿真训练再迁移到真机,但电池组装这类有明确工序和规则的任务,或折叠布料等柔性物体操作,仍需要真实世界中的演示提供指引。

蚂蚁灵波科技首席科学家沈宇军在9月10日主论坛圆桌上抛出了另一个问题。行业过去谈得更多的是Sim-to-Real,即如何让��真训练结果迁移到现实。但真正困难的也可能是Real-to-Sim——现实传感器中的噪声、误差以及触觉信号差异,能不能规模化地被搬进仿真系统。他以触觉为例:真实传感器在频率、幅值和一致性上的变化,并不容易完整复刻。

外滩大会追问具身智能:数据越多越聪明吗?
外滩大会追问具身智能:数据越多越聪明吗?

真实数据的"采集陷阱"

真机数据即便采回来,也并非直接可用。香港大学计算与数据科学学院副院长罗平提到一个直白的案例:他们曾尝试直接采集真实药剂师工作的数据,任务足够真实,但人工作业时的运动并不以数据采集为目标,"采回来的数据质量差到离谱"。

极佳视界联合创始人兼首席科学家朱政的经验更为极端。他透露,此前与地方合作的一些数据采集项目中,由于采集过程缺乏模型公司直接控制,大约90%的数据被浪费。这意味着行业在数据上的投入,可能有相当一部分是在烧钱。

世界模型:动手之前先预测

当真机数据难采、仿真又无法覆盖现实中的所有细节,世界模型成为另一条被频繁讨论的技术路线。核心思路很直接:机器人能不能在动手之前,先预测动作的后果。

在此次外滩大会世界模型论坛上,忆生科技联合创始人兼CTO、香港大学计算与数据科学学院助理教授杨言超把世界模型需要具备的能力概括为三层:理解和预测未来、从数据中提取结构并形成记忆、依靠记忆持续学习。他认为,当现实试错昂贵、训练数据难以获得时,让模型先预测动作后果更有价值;但如果任务简单、试错成本很低,并不一定每次都需要调用世界模型。

GPT-6 Astra的"降维打击"与最后阵地

9月3日,OpenAI发布GPT-6 Astra并向部分机构开放。社交媒体上随即出现Astra直接控制机械臂完成任务的视频。如果通用大模型已经能够控制机器人,具身智能公司会不会遭遇"降维打击"?

许华哲的团队在Astra开放后进行了测试。他的评价审慎而具体:Astra在语义和空间能力上已经很强,能够识别桌面物体、抓起筷子,甚至将筷子插进杯子。但一旦进入叠衣服、复杂接触等任务,表现明显下降。"这也是具身机器人公司一个最后的阵地,就是怎么样理解这个物理变化。"按照他的判断,这两类模型未来更可能配合而非替代——通用大模型负责语义理解和空间感知,具身智能公司负责物理交互的精细控制与泛化。

行业正经历一场预期重塑

外滩大会呈现的图景是完整的:硬件在放量,数据在膨胀,模型在迭代,场景在拓展。但真正的技术瓶颈——泛化能力——尚未被任何一家公司彻底突破。

数据不是越多越好,而是越有效越好。仿真不是万能的,真机也不是万能的。世界模型有价值,但不是所有场景都需要它。通用大模型很强,但在物理世前仍有边界。这些判断来自从业者的亲身实践,而非空想。对具身智能行业而言,2026年可能不是爆发之年,而是预期重塑之年——从追求参数和数据规模,转向追问数据质量、模型有效性和场景稳定性。那些在展台上令人惊叹的Demo,距离工厂车间和家庭厨房里的长期可靠运行,仍有相当长的路要走。

本文由AI辅助生成

分享到: