一段在机器人开发者社群流传的内部测试视频,让具身智能的短板暴露得颇为直观。9月7日上午,视频中的机械臂搭载视觉语言模型,执行“将水杯推到桌边”的任务。工程师在桌沿悄悄放了一块三厘米高的木条,机械臂的路径规划随即出现明显抖动,水杯在距木条两厘米处停滞了四秒。这位工程师在评论区写道:“我们缺的不是更聪明的头脑,是更能扛住真实世界干扰的眼睛。”
数小时后,智象未来(HiDream.ai)正式发布具身世界模型HiDream-O1-Embodied。据公开信息,该模型参评具身智能评测平台RoboColiseum,在核心的Robustness(扰动适应)子榜单以平均分0.692登顶,较此前最高公开记录提升约0.04——在评测体系中,这一区间被认为具有显著区分度。
扰动适应为何成为分水岭
RoboColiseum是面向具身智能模型的标准化评测平台,其Robustness子榜衡量模型在光照变化、物体位移、遮挡干扰、传感器噪声等条件下的任务成功率与路径稳定性。与单纯追求理想桌面环境下的任务完成率不同,扰动适应能力直接对应机器人在工厂、家庭、仓储等非结构化场景中的实际可用性。
据业内人士解释,当前主流具身模型多采用“视觉编码器+语言推理+动作生成”的流水线架构。视觉模块一旦遇到训练数据中从未出现过的干扰组合,上游识别误差就会在下游动作规划中逐级放大。HiDream-O1-Embodied在架构层面对时空一致性做了显式建模,使模型能在连续帧之间维持对物体位置、姿态和遮挡关系的稳定估计——通俗地说,它更擅长“记住前一秒看到了什么”,而不是每一帧都从零开始重新理解世界。
世界模型正在改写竞争规则
过去两年,具身智能的竞争焦点经历了明显迁移。2024年至2025年上半年,行业注意力集中在机器人本体硬件与大语言模型接入,大量初创公司比拼“机械臂+多模态大模型”的快速落地能力。进入2026年,随着实际部署中暴露出的环境适应性短板,产业资源开始向“具身世界模型”这一中间层倾斜。
与直接输出动作指令的端到端模型不同,世界模型的核心任务是预测环境在时间维度上的演化。HiDream-O1-Embodied的路线是先学习物体运动、碰撞、遮挡的基本物理规律,再在预测框架内生成动作。这带来的直接好处是:当真实场景出现训练数据之外的干扰时,模型具备更强的外推能力。据公开信息,智象未来在训练中引入了大规模合成物理场景数据,覆盖超过200种材质组合与47类常见扰动模式。
横向对比,谷歌DeepMind的Genie系列与英伟达的Cosmos平台同样布局世界模型方向,但前者侧重游戏与视频生成,后者偏向自动驾驶与数字孪生。具身机器人领域的世界模型至今没有统一的评测基准,RoboColiseum的Robustness子榜是少数公开可比的量化指标之一。智象未来选择以该子榜作为发布口径,信号相当明确:要在“环境适应能力”这一尚未被巨头锁定的细分赛道上,建立可量化的技术信用。
0.692分的含金量与局限
0.692意味着什么?在Robustness子榜中,该分数代表模型在多数干扰条件下仍能保持任务完成率不低于无干扰场景的七成。据该平台此前发布的评测报告,行业参评模型的平均分大致在0.45至0.58之间。一位长期跟踪具身智能评测的产业研究者表示,0.65以上通常被视为“具备真实场景部署潜力”的门槛线,但距离工业级可靠性要求仍有明显差距。
局限同样存在。该子榜目前以桌面级操作任务为主,涵盖抓取、推移、倾倒、插拔等基础动作;对移动操作、双手机器人协同、长时序任务等更复杂场景,评测体系尚无法给出完整评估。此次登顶验证了智象未来在特定任务域的环境适应能力,但不能直接等同于整套具身智能系统的成熟度。
商业化时间表仍不明朗
智象未来未披露该模型的商业模式细节。据公开信息,公司2025年完成的新一轮融资中,投资方包括多家聚焦先进制造的产业资本。具身世界模型可能的商业化路径有三条:向机器人整机厂商提供模型授权、以云端API输出环境预测能力、在数据采集与仿真训练环节提供工具链服务。
从行业数据看,具身智能的规模化落地低于此前多数机构的预测。高盛全球研究部2026年1月发布的《人形机器人与具身智能产业更新报告》显示,全球人形机器人2025年年出货量约为1.2万台,远低于2023年行业平均预期的4万台。报告同时指出,制约出货量的首要因素已从硬件成本转向“非结构化环境中的任务成功率”——这一判断与智象未来选择世界模型路线的逻辑相互印证。
竞争压力同样不容忽视。头部机器人公司正在加���自研具身模型,部分企业已将世界模型能力内化为整机系统的默认组件。第三方模型供应商若不能在性能领先窗口内建立足够规模的客户生态,技术优势可能被快速稀释。此外,世界模型训练所需的合成数据质量与物理真实性仍存争议,部分学术界观点认为,过度依赖合成数据可能导致模型在极端场景下产生“物理幻觉”。
中国团队的窗口期
具身智能的世界模型竞争,正在成为中美科技公司之间少有的“同一起跑线”赛道。与大语言模型时代中国团队在数据与算力上面临的结构性差距不同,具身世界模型更依赖高质量物理交互数据、机器人硬件测试环境以及场景落地渠道。中国在制造业场景密度、机器人供应链成本和硬件迭代速度上的优势,为本土团队提供了独特的实验土壤。
智象未来此次登顶,是中国团队在具身智能基础模型评测体系中少有的公开登顶案例。但0.692能否转化为客户订单、部署案例和持续的评测领先,仍需更长的观察周期。
那位在开发社群发视频的工程师留下的最后一句话,或许更接近这个行业的真相:“当机器人第一次在木条前没有犹豫时,我不会关心它背后的模型叫什么名字,我只会问,多少钱,什么时候能用。”
本文由AI辅助生成



