作者|毛心如
如果一个机器人已经知道锤子怎么拿、钉子往哪敲,它就能钉好钉子吗?
答案未必。
真挥锤时,机械臂要在极短时间内完成加速、对准、击打,再迅速卸掉反冲力。慢一点,力道不够;偏一点,钉子歪斜;中间若因等待模型推理而停顿,前面积累的速度瞬间归零。
正确动作不是某个静态终点坐标,而是一整段连续过程,速度、加速度、衔接节奏,每一步都关乎成败。
这是机器人从 Demo 走向真实场景后,绕不开的坎。
过去两年,具身智能的核心命题是会不会。VLA、世界模型、基础策略不断堆规模,想让同一个模型应对更多任务。
可当模型把机器人推到基本会做的门槛上,另一类问题浮出水面。
知道杯子在哪,倒水总差几毫米;知道拆箱步骤,刀片切入总偏一点;知道投掷动作,却无法根据目标距离调整释放速度。
Demo 里,这些都是差一点;真实部署中,差一点就是失败。
这说明,具身智能正经历一次重要转向:过去关心能不能学会,现在关心学会之后,能不能长期稳定地做成事。
于是新问题来了,既然机器人已经进入真实世界,训练,是否也该进入真实世界?
星尘智能发布的SmoothRL,恰好回应其中一个具体又绕不开的问题:当机器人一边执行动作、一边等待大模型下一轮推理时,在线强化学习究竟该从哪些动作里学?
技术报告来源:https://www.astribot.com/en/research/SmoothRL
基础模型教会机器人以后,
真正的难题才开始
过去两年,行业大量资源投入 VLA、世界动作模型研发,通过海量示教数据预训练,目标是让单一基座模型掌握尽可能多的操作技能。
这是通用机器人必经的上半场。
但大量真机落地实践证明,模型泛化能力和物理环境下的任务可靠性,是两套完全不同的能力。
基座模型从海量数据中学到的是具有一定泛化能力的行为模式,面对现实世界里物体摆放偏移、摩擦力变化、光照扰动、本体微小磨损,很容易产生毫米级、毫秒级的系统性偏差。
这些长尾场景,很难全部塞进预训练数据集。
因此,基座模型训练完成,也不代表机器人产品能力就走到了终点。
同时一条全新的技术进化链路正在浮现:预训练部署上岗获取真实环境反馈后训练微调重新部署。
基座模型负责打通广泛任务的通用泛化,而后训练则扎根真实作业现场,专门攻克特定任务的可靠性短板。
这也是 Online RL(在线强化学习)重新受到关注的原因:机器人真正工作之后,真实环境会不断产生预训练阶段难以覆盖的数据,而RL 提供了一种利用这些反馈继续优化策略的方式。
但现实世界还有一个约束:机器人没有暂停键,不能停下来等大模型完成推理。
随着 VLA 基座模型规模越来越大,单次推理耗时随之变长。
如果采用传统同步推理模式:机器人原地等待模型算完整段动作,算完再动;遇到投掷、敲击这类高动态任务,等待停顿会直接丢失运动动能,任务直接失败。
于是,异步推理(Asynchronous Inference)成为解决这一矛盾的一种重要方式。
机器人继续执行上一轮已经下发的动作,后台模型并行计算新的动作块(Action Chunk);新动作计算完成后再切换执行,尽可能把模型推理时间隐藏在机器人运动过程中。
但这也带来了一个新的问题:模型生成的动作,和机器人真正执行的动作,不再完全一致。
而对于强化学习来说,这恰恰是一个必须解决的问题。
机器人不能停下来等模型,
SmoothRL 要解决的其实是一笔账
以常见配置为例,模型一次性生成一段 32 帧的动作块。
由于推理耗时覆盖了 6 个控制周期,当新动作块计算完毕时,机器人已经执行完了前 6 帧;而动作块末尾的 20 帧还没来得及运行,就被下一轮新生成的动作直接覆盖丢弃。
于是出现了核心矛盾:模型规划的完整 32 帧,不等于机器人真正执行的 6 帧。
传统在线强化学习算法几乎都默认同步执行假设,会把完整动作块全部当做成绩单来计算梯度更新策略。
这就会出现严重的信用分配问题:任务成功时,那些从未被执行过的动作也跟着记功;任务失败时,那些从未发生的动作也跟着背锅。
学习信号被大量无效动作污染,训练与真实部署之间出现了巨大的错位。
SmoothRL 要解决的就是这个问题,它的设计包含两个核心层面。
第一,对动作块做三段式划分,并采用不对称梯度更新:
已提交区域(Committed Region):这部分动作已经被提交执行,本轮策略无法修改。
执行区域(Execution Region):这是整套动作块中机器人实实在在运行、并产生真实物理反馈的片段,也是唯一应该被用来学习的片段。
丢弃区域(Discarded Region):还没来得及执行就被下一轮动作块覆盖,排除在策略更新之外。
在算法实现上,价值网络(Critic)需要看到已提交区域+执行区域的全部信息。
因为机器人运动是连续过程,加速、转向等物理状态承接自上一段运动,Critic 需要看到完整的前序动作才能准确理解当前状态。
但策略网络(Actor)在反向传播梯度更新时,梯度只允许穿过执行区域。
简单来说,Critic 要看到完整的上下文来评估状态,但不能让已经发生且无法改变的动作,来影响当前策略的优化方向,Actor 只对真正执行过的动作负责。
第二,贯彻训练即部署的工程原则。
很多方案在训练阶段使用理想的同步环境,到产品部署时才切换异步模式。
SmoothRL 则选择在训练轨迹生成(rollout)阶段就完整运行异步推理环路,让训练经历的推理延迟、动作切换和执行节奏与真实部署保持一致。
也就是说,它追求的不只是场景对齐,还要对齐机器人真正执行动作的时间节奏。
此外,为了防止强化学习为了追求成功率而学出抖动、突兀或有安全风险的激进动作,SmoothRL 还加入了平滑性约束,同时关注速度、加速度和加加速度。
这也是「Smooth」命名的由来,成功不是部署的唯一指标,动作还必须连贯、稳定、可执行。
从差一点到稳定做成,
机器人开始在工作中修正自己
星尘智能的自研绳驱机器人本体 S1 为 SmoothRL 提供了验证平台。
S1 采用绳驱传动设计,能模仿人的核心运动指标,在末端最高速度、最大加速度、重复定位精度上具有天然优势,这种高动态硬件能力,为投掷这类对机器人较难高动态任务提供了硬件基础。
值得一提的是,目前同类算法研究大多停留在静态高精度任务,高动态真机在线 RL 的公开验证案例相当稀缺。
星尘智能在 S1 上完成三项覆盖高动态与高精度的典型任务真机验证,都获得了显著提升。
动态物体投掷,机器人抓取物体投掷至目标容器,成功率由 39%提升至 94%。
这项任务要求手臂在摆动过程中持续加速、在准确时刻释放,全程不能中断控制。
一旦在动作块边界发生停顿,已积累的动能可能归零,这是异步推理必须解决的典型场景,也是 SmoothRL 差异化能力的集中体现。
笔帽装配,双臂完成笔与笔帽的对位,允许误差仅 5 毫米,成功率由 8%提升至 83%。
纸箱开箱,约 1 毫米宽的刀片对准仅 2-3 毫米的纸箱缝隙切割胶带,成功率由 30%提升至 90%。
三个任务放在一起看,刚好覆盖了两类机器人能力:投掷考验高速、连续的动态控制,笔帽装配和开箱则考验精细操作中的空间精度。
比成功率数字更值得关注的是错误模式的本质变化。
预训练基座模型往往表现出方向性极强的系统性偏差:投掷时不能根据目标远近调整释放速度,开箱时刀片固定向左偏移,笔帽装配面对不同位置输出动作几乎一成不变。
经过 SmoothRL 在线迭代后,这些系统性偏差得到修正,机器人不需要重新学习整项技能,而是在原有策略基础上不断校准。
这也是 Online RL 对机器人产业化最直接的价值:它未必需要重新教机器人一项技能,而是把基本能做继续推向稳定可做。
从商业落地视角看,成功率差距会被作业频次成倍放大。
如果一项动作每天重复 1000 次,99% 成功率代表一天 10 次故障;95% 成功率则是 50 次故障。
机器人产品的商业竞争力,也在从能不能做出来 Demo,转向失败率是否低到足以投入业务使用。
当然,SmoothRL 的边界也需要客观看待。当前方案仍依赖任务成功/失败奖励,支持人工介入,并主要在冻结的基础策略附近做残差修正。
它还不能与完全自主进化画等号,真正的自我进化依赖于机器人稳定性、易用性以及对海量长尾情况的处理。
更准确的定位是,它实现了部署真实数据反馈模型更新的闭环校准。
把 SmoothRL 放回星尘智能的完整技术体系,闭环逻辑会更加清晰。这也构成了这家公司的两层核心护城河:
第一层,完整的软硬件全栈闭环。
AI 模型、具身操作系统与绳驱机器人本体形成完整链路:本体执行任务产生真实物理数据SmoothRL 进行在线优化生成新策略下发部署机器人再次执行产生更多数据。
在这个循环里,本体既是执行终端,也是数据源头;RL 则成为把真实执行反馈重新转化为策略能力的中间环节。
机器人部署出去之后,价值并没有停留在交付这一刻,每一次真实执行,都可能成为下一轮优化的输入。
第二层,模型技术路线的持续演进:
Agent(Philia):理解人类意图与长期任务
基座模型(Lumo 系列):提供通用操作能力与泛化性,Lumo-1 理解为什么这样动,Lumo-2 进一步预测这样动之后世界会怎么变
机器人本体 S1、T1:在物理世界执行,并持续产生真机数据
SmoothRL:根据真实世界反馈,精准修正动作
真实数据再反哺模型,进入下一轮迭代
五层环环相扣,从理解到执行到反馈到再学习,构成一条完整的进化链条。
长久以来,行业习惯了训练部署结束的线性思维:实验室里把模型训练完毕,交付后能力就此固定。
而机器人规模化落地的未来,需要切换成循环思维:训练部署上岗实际作业产生反馈后训练再部署。
这意味着未来机器人公司的竞争壁垒,不再只是谁的参数量更大、Demo 更惊艳、数据集更多,而是谁能让真实上岗作业这件事,成为模型持续进化的来源。
基座大模型教会机器人应该怎么做;而真实物理世界中一次次成功与失败,继续告诉它怎样才能做得更稳、更准。
SmoothRL 解决的只是异步在线强化学习这一个具体的技术难题。
但它指向的命题更大:当机器人真正投入工作之后,工作本身,能否成为它下一轮进化的训练素材?
未来的机器人,出厂时不是能力的终点。日复一日上岗作业的过程,就是它持续打磨动作精度的过程。
真正的 Physical AI,不只是服务器上表现优异的模型,更是一台可以在不停机、充满扰动的现实世界中,边运行、边学习、边成长的机器。