分类:AI动态 标签:人工智能、具身智能、机器人、大模型
当 2026 年世界机器人大会在北京亦庄开幕时,300 多家企业与 2000 多件展品将具身智能行业的全貌摆上了台前。与此同时,宇树科技敲钟上市,盘中市值冲破 4000 亿元,为这个长期活跃在实验室、融资新闻和 Demo 视频里的赛道钉下了首个资本锚点。
一级市场的热度正向二级市场传导,具身智能不再只是纯粹的技术想象,行业开始被要求正面回答收入、交付、毛利和规模化等现实问题。比起追问何时会出现奇迹,更值得探究的是几个更朴素的底层问题:机器人是不是只能长成人的样子?具身智能的通用性究竟走到了哪一步?数据正在变成一门硬件生意吗?藏在指尖、关节和电机里的关键部件又推进了多少?
透过各大代表性企业的实践,我们可以梳理出这个赛道正在发生的关键变革。
1. 机器人是不是只能是人形?
过去两年,具身智能的叙事几乎被「人形机器人」全面占领。但从本届大会来看,「像人」不再是唯一的标准答案。在人形之外,越来越多公司开始根据真实任务重新设计机器人的形态。
- 形态分化与场景倒逼:宇树科技带来了全新格斗形态的 G1 与更大输出功率的 H2,同时展出了 3 米高、能载人变形的机甲 GD01,进军文旅与特种作业;维他动力发布人形具身智能终端 Vbot ATOM,通过承接四足机器人「大头」的量产交付经验,反向定义出适应家庭与公共空间的产品形态。
- 垂直场景的高效落地:未来不远机器人聚焦家庭场景,通过全栈自研的 WAM 世界动作模型,在现场稳定完成了双机协同与端到端意面制作;自变量机器人则在物流分拣场景中,采用双机械臂配合普通夹爪的非完整人形方案,实现了每小时 1816 件、准确率超过 98% 的高效运转。
2. 具身智能的通用性走到哪一步了?
具身智能的通用性,体现在跨物体、跨环境、跨指令完成复杂任务的能力上。目前行业已跨过「单一动作展示」阶段,先进的机器人能够完成多技能串联、状态跟踪,并在遭遇扰动后重新规划。
在模型路线尚未收敛的背景下,各大厂商交出了不同的解法:
- 端到端与世界动作模型:银河通用发布的双足机器人 Galbot ET1 搭载了 AstraBrain WBC 小脑基座模型,能够实时模仿人类动作并进行高动态网球对抗;未来不远与自变量则分别通过 WAM 和 WALL-B 模型,将视觉、语言、触觉和物理规律融合进统一网络。
- 分层架构与跨本体复用:逐际动力 COSA 采用三层大脑架构(System 2 负责推理调度,System 1 调用操作技能,System 0 负责 1000Hz 全身运动控制);星海图 G0.5 则通过统一动作编码,让同一套模型适配不同的机器人本体,推动通用能力在长程任务中落地。
3. 具身数据正在变成一门硬件生意吗?
无论是通用性能还是垂直场景表现,模型都需要海量高质量数据的支撑。当前的数据采集涵盖遥操作、无本体 UMI、第一视角采集与真机本体采集等多种方式,这让许多人感叹具身数据正在变成一门硬件生意。
然而,数据的核心价值在于反哺模型、形成数据飞轮。
- 多样化的数据源:光轮智能通过 SimFoundry 仿真和 RoboFinals 评测体系构建 Real2Sim2Real 数据闭环;极佳视界则利用世界模型作为数据放大器,批量生成训练所需的交互数据。
- 数据闭环的演进:单纯的集中式数采已难以满足需求,行业趋势正从「集中式数采工厂」走向「机器人部署现场」。通过将真机运行数据实时回流并进行模型 Post-Training,才能真正加速具身智能的迭代。
4. 关键部件往前走了几步?
关键零部件的进步,往往更能展示行业底层的推进速度。其中,灵巧手与感知系统构成了具身智能落地的关键一环。
- 灵巧操作与触觉感知:灵心巧手展示了「灵巧手组装灵巧手」的案例,将精细操作推向工业级应用;帕西尼感知则依托多维触觉芯片与电子皮肤,将触觉感知从指尖扩展到全身,使机器人能够凭借力触觉反馈完成自主拼装等复杂任务。
- 视觉与硬件协同:奥比中光推出专为具身智能设计的 Gemini 330 系列及视觉新品 Physis,并在多视角数据采集上发力,为机器人提供贴近人类的高质量空间感知能力。
总结:具身智能的故事刚刚开始
具身智能当下的热潮,不免让人联想到十年前的计算机视觉与自动驾驶。从实验室原型到稳定、低成本、可规模部署的产品之间,依然存在着漫长的工程距离。
技术热潮往往会让人高估近期的落地速度,却也容易低估长期的产业影响。中国拥有完整的机器人供应链、制造能力与丰富的真实场景,能够加速整机试制与数据闭环的形成。当机器人真正开始在工厂、仓库和家庭中稳定工作时,具身智能真正有价值的篇章,才刚刚拉开序幕。