分类:AI动态 标签:具身智能、大模型、机器人、开源项目
在具身智能领域,“自进化”一直是一个备受争议的词汇。当乐享科技近期推出其具身智能模型“以太”(Aether)大模型,并宣称它是全球首个能在部署和执行过程中持续更新、实现“自进化”的模型时,行业内外随之涌现了大量的讨论与审视。
模型的参数变化究竟是临时的任务调整,还是可迁移的新能力?在机器人行业仍需攻克基础稳定执行难题的当下,自进化究竟意味着工程层面的泛化,还是更深层次的持续成长?带着这些疑问,我们不妨深入剖析这套新型的技术思路。
01 从模仿动作到理解因果:打破传统 VLA 的局限
过去几年,具身智能的主流路线是将视觉、语言和动作(VLA)相连接:机器人接收视觉环境与任务指令,随后直接输出动作。这种路线让人类示范得以被大规模学习,但乐享科技团队指出,它存在一个根本限制:擅长回答“下一步做什么”,却未必理解“为什么要这样做”。
- 传统 VLA 的痛点:缺乏因果理解,更接近从已有数据中学习动作规律。
- 传统世界模型的问题:往往“可生成、不可执行”,预测出的未来无法被实际的关节、力矩和控制系统所实现。
真实世界的物理环境充满变数——接触力、摩擦力、滑动、物体形变及目标的临时变化,都会让同样的动作产生截然不同的后果。为此,乐享科技将“以太大模型”设计为一个由世界状态、内部状态和能量状态耦合而成的动力系统,并称之为“能量驱动的状态转移”(energy-driven state transition)。
在这个系统中,感知不再是被动的画面接收,而是带有“感知意图”的主动探索:为了继续行动,我还需要看到什么?当前视角能否消除不确定性?这种由系统内部一张贯穿始终的评价地形(Landscape)来衡量的机制,让机器人开始真正理解行动与物理世界的因果关系。
02 自进化背后的闭环机制:错题本与分层记忆
“自进化”不能只是一句宣传口号,它必须回答三个核心问题:机器人能否发现现实与预测的偏差?哪些经验值得留下?经验能否迁移到新任务和新身体上?
乐享科技为此构建了一套严密的运行闭环:
- 持续的预测与修正:机器人行动前形成预测,执行后观察结果,比对现实偏差并实时更新内部状态。这一循环伴随每一次行动持续发生。
- 严格的经验筛选(错题本机制):在线学习最大的风险在于把偶然扰动当成规律。以太大模型在引入新经验时会进行评估:是否可靠、是否新颖、能否归因。系统会主动过滤错误经验,知道“什么该学,什么不该学”。
- 分层记忆与参数更新:
- 临时的短期经验:生命周期短,任务结束后即被清除。
- 验证后的长效规律:保留时间长,甚至可能影响模型权重,实现真正的参数层更新。
此外,该模型展现出了优秀的“一脑多形”能力。通过接入双臂、双足和轮式等不同形态的机器人本体,以太大模型能够在接入新硬件后通过自主探索认知本体的性能差异,生成适配的动作轨迹,从而完成软硬件解耦。
03 具身智能的 Next Level
如果机器人能够摆脱“被训练的执行机器”这一传统定位,进而在行动中发现偏差、在反馈中筛选经验、在记忆中沉淀规律,并把这些能力带到新的任务和身体中,那么它就不再只是更会干活,而是开始具备真正的“生长性”。
当然,对于“自进化”这一概念,未来仍有许多问题需要时间去检验:泛化能力究竟能跨越多大差异?长期运行后旧能力是否会发生退化?新能力能否在不同硬件上稳定复现?
尽管如此,这种探索无疑将行业的问题向前推进了一大步。衡量机器人的标准,或许将正式从“它现在会做什么”跨入到一个全新的维度:“它做完之后学会了什么?”这,正是具身智能迈向下一个阶段的重要信号。