在具身智能从仿真环境走向真实应用的关键阶段,如何应对光照变化、视野遮挡、信号波动等强扰动因素,成为制约其泛化能力与稳定性的核心挑战。近日,智象未来(HiDream.ai)正式发布具身世界模型HiDream-O1-Embodied。模型首次参评具身智能模型评测平台RoboColiseum,即在核心的Robustness(扰动适应)子榜单中以平均分0.692登顶榜首。在业内人士看来,该模型基于全模态表达、因果推演与物理世界构建三大能力,搭建起完整的世界模型基座,为具身智能从模拟环境迈入真实应用提供了新的技术路径。

扰动适应能力突破仿真瓶颈
HiDream-O1-Embodied的核心竞争力,体现在对真实世界强扰动环境的适应性上。RoboColiseum平台围绕指令跟随、空间理解、扰动适应与通用操作推出4类能力子榜、78个高保真仿真评测任务。其中,扰动适应通过改变背景、光照、材质、相机位置及图像质量等变量,检验模型在非理想环境中的稳定性与泛化能力,被公认为最具挑战性的子榜单。
“说‘把杯子拿过来’能听懂,换成‘给我拿个杯子’就可能‘宕机’。”智象未来CTO姚霆在接受上证报记者采访时介绍,在语言理解层面,模型突破传统机器人依赖关键词匹配的局限。HiDream-O1-Embodied覆盖多元动词、句式与表达方式的等价指令空间。
视觉感知方面,模型综合多个视角信息协同判断,避免依赖单一固定视角。当部分视觉信号出现偏差或暂时中断时,系统仍能借助其他视角理解场景并继续执行,实现从“一处失灵、全局失效”到“局部受限、整体仍可运行”的转变。
姚霆介绍,多数模型的训练基于“完美数据”,但真实世界并非如此。光照变化、画面污损、视野遮挡、信号波动,都是机器人日常可能遇到的状况。HiDream-O1-Embodied在训练阶段主动引入多种非理想条件,让模型反复面对不完整、不稳定的信息,并学会从有限线索中作出可靠判断。

此外,智象未来探索出“真实基座+生成增强”的数据生产范式,以与诺亦腾的合作为例,基于高精度真人动作捕捉数据,模型可生成百倍级变体视频,在恪守物理约束的前提下自由切换背景、光照、物体形态等变量。“模型既做‘考生’,也做‘出题人’,根据自身薄弱环节主动生成针对性训练样本,形成数据与模型互相驱动的增长飞轮。”姚霆介绍,这一机制让HiDream-O1-Embodied在面对真实世界强扰动时,展现出超乎寻常的抗干扰能力。
具身智能市场迈入万亿规模
具身智能正成为人工智能产业增长最快的赛道之一。据中商产业研究院报告,2026年具身智能由概念验证迈入小批量商用元年。2025年中国具身智能市场规模约9150亿元,预计2026年将达10904亿元,全国具身智能相关企业已突破万家。
全球视角下,据市场研究机构测算,2026年全球具身智能市场规模为62亿美元,预计2035年将达1193亿美元,复合年均增速39%。其中,中国市场将由28亿美元增长至662亿美元,全球占比从45%提升至55.5%。
人形机器人细分领域同样增长迅猛,中商产业研究院预计2026年中国出货量约3.8万台、市场规模约34亿元,2030年出货量有望达38万台、市场规模突破200亿元。
据IT桔子、CENTI不完全统计,仅2026年第一季度,具身智能赛道披露融资超50起,累计融资额突破200亿元,同比增长近60%,创历史新高。世界模型作为具身智能核心技术底座亦备受关注,据行业报告,2026年全球世界模型市场规模约127.4亿美元,较2024年的72.8亿美元增长75%。摩根士丹利预测,到2035年由世界模型赋能的产业规模将达10万亿美元。
据智象未来透露,HiDream-O1-Embodied预计最先在人形机器人、机械臂等场景落地,公司已与诺亦腾机器人达成战略合作。就在不到一个月前,智象未来发布交互式世界模型HiDream-O1-World,并在WBench基准测试中以80.9分登顶。交互式模型解决“理解与推演”,具身模型解决“操作与执行”,两者形成互补。
据悉,今年7月,智象未来完成15亿元C轮融资,由社保基金四川振兴科创基金、工银资本等联合领投。近三个月内累计融资超21亿元,正式跻身独角兽行列。“下一代大模型竞争的关键,不在于单一模态能力的增长,而是从单模态走向多模态,并走向原生统一的全模态。”智象未来创始人兼CEO梅涛表示。
作者:邹传科

作者:上海证券报








