ARTICLE · 1030632
AI翻译局 · vol.087 · SmoothRL:机器人的神经反射弧
AI翻译局 · PRODUCT TEARDOWN · vol.087 机器人没有暂停键——SmoothRL 给异步执行装上一条"反射弧" 拆星尘智能(Astribot)SmoothRL:在线强化学习为什么必须学会"只对真正做过的动作负责" |
先说清楚一件容易被忽略的事:现在的 VLA(视觉-语言-动作模型)、World-Action Model,推理一次不是吐出一个动作,而是吐出未来一整段动作序列——业内叫 action chunk。模型越做越大,算一次 chunk 要的时间也越来越长,但机器人手上的活儿不能等:投掷一个物体需要手臂持续加速再在精确时刻甩出去,一旦在等模型算完的间隙里卡顿一下,速度就掉下去了,动作等于白做。于是真实部署里,行业公认的解法是异步推理——机器人继续按上一段指令往下做,模型在后台同时算下一段,"手上做 A、脑子算 B"。2026 年 9 月 2 日,据科技日报与量子位报道,中国具身智能公司星尘智能(Astribot)基座模型团队发布了一套专门针对这一异步场景设计的在线强化学习框架 SmoothRL,并同步公开了 arXiv 技术论文(arXiv:2608.29768)。 这篇拆的不是"星尘又出新技能了",而是一道更底层的工程矛盾:异步推理解决了机器人"不用停下来等模型"的问题,却顺手制造了一个新麻烦——模型这次到底"算过"什么、机器人这次到底"做过"什么,这两件事不再是同一件事,那强化学习到底该拿哪一段动作去学、去打分?这道题不难理解,但少有团队把解法的工程细节讲到"哪一帧算执行、哪一帧算丢弃"这个颗粒度并公开发表。逐段拆。 |
▌ PART 01 · 困境 · 机器人为什么不能像大模型一样"停下来想清楚再动" 人类甩鞭子不用先思考——脊髓比大脑先做出反应 对话式大模型可以"想清楚再说":多花几秒推理,用户最多多等一会儿,答案通常更好。机器人不是这样。它的身体在物理世界里连续运动,重力、惯性、摩擦力不会因为模型还在推理就暂停。星尘的团队举的例子很直接:动态投掷任务里,手臂需要在摆动过程中持续积累速度,一旦在 action chunk 的边界处发生停顿,手臂可能几乎降到静止,剩余的摆动很难重新恢复到需要的释放速度——同步等待模型这一步,代价不是"慢一点",是"这次任务直接失败"。这正是为什么行业转向异步推理:让机器人按上一段已经算好的动作继续走,模型同时在后台计算下一段,谁都不用等谁。 这个设计思路,在生物体上其实早就有现成答案:脊髓反射弧。手碰到烫的东西会先缩回来,之后才"意识到"烫——这个先后顺序不是错觉。感觉神经把信号传到脊髓,脊髓里的中间神经元直接把指令发给运动神经元、驱动肌肉收缩,整个回路根本不经过大脑;与此同时,另一路较慢的信号才继续往上传到大脑,形成"意识到烫"和后续的判断。反射弧解决的正是"决策速度"和"动作连续性"的冲突:需要立刻响应的动作交给离身体最近、传导路径最短的回路;需要通盘考虑的判断,留给较慢但更全面的大脑。 异步推理架构里的"大脑"和"脊髓",分别对应模型的规划链路(算下一段该做什么)和机器人的执行链路(把已经算好的动作真正做出来)。但异步推理只解决了"不用互相等"这一层问题,没有回答另一层:当机器人已经在按旧计划往前走、新计划又中途插进来的时候,这段动作到底算谁的账——是新计划的功劳,还是旧计划的遗留?这正是 SmoothRL 要解决的问题,也是接下来这一段的重点。 |
▌ PART 02 · 机制 · 三区域切分:只对真正做过的动作打分 一段 32 帧的 action chunk,只有 6 帧真正被机器人执行过 先把"对账问题"讲透。传统的在线 RL 默认一种干净的对应关系:模型算出动作,机器人执行,再根据结果更新策略——模型生成什么,机器人就执行什么,中间没有落差。异步执行打破了这层对应:新一段 action chunk 算出来的时候,机器人已经沿着上一轮的指令往前做了一截;这段新动作还没执行完,下一轮推理结果可能又到了,把后半段直接替换掉。结果是同一段被模型生成过的 chunk 里,有些动作已经来不及改(上一轮已经"钉死"了),有些真正被执行了,还有一些根本没发生过(还没轮到就被下一轮覆盖)。如果 RL 把整段动作一视同仁地拿去优化,机器人"来不及改"或"根本没做过"的动作,也会因为这次任务成功被记功、或因为失败被背锅——这是一种错误的信用分配(credit assignment)。 SmoothRL 的做法是先把这笔账按帧号拆干净:把每一段生成的 action chunk 划分成已提交区域(committed region)——上一轮推理已经提交、不能再改的动作;执行区域(execution region)——这一轮新生成、机器人实际会执行的动作;丢弃区域(discarded region)——模型算过、但会被下一轮推理结果覆盖、机器人根本不会执行的动作。训练时只让价值梯度穿过执行区域——用星尘团队的表述,就是"机器人真正执行了什么,就只对什么进行强化学习"。据量子位援引星尘技术报告的实测参数:星尘 S1 以 30Hz 执行动作,推理请求频率为 5Hz,即每 200ms 得到一个新 chunk;基础策略(针对各任务微调后的 π0.5)每次预测 32 帧动作;在固定延迟预算下,Committed 与 Execution 共占 12 帧,其中只有 6 帧属于本轮真正执行的 Execution Region,其余 20 帧在真正执行前就会被下一轮 chunk 覆盖丢弃——一段模型生成的 32 帧动作里,接近三分之二从未被机器人做过,如果这些帧也被计入训练信号,学到的策略优化目标和机器人真实运行时经历的过程就会脱节。 在算法实现上,SmoothRL 遵循的是value-gradient 范式:不是靠采样整条轨迹再做策略梯度更新,而是直接用动作价值函数(action-value function)对动作求梯度,反向传播去更新策略参数——论文原文的表述是"directly updating policy parameters using gradients of the action-value function with respect to policy actions"。具体结构上,团队保持基础策略 π0.5 冻结不动,沿用 RLT 的骨架,用一个轻量的 TD3-style actor-critic,在原始动作空间里预测一段残差修正(residual correction),叠加在基础策略输出之上。更关键的是训练本身的节奏:团队把这一原则叫 Reinforce in Deployment——不是先在一个理想的同步世界里训练完,再切换成异步方式部署,而是训练用的 rollout 本身就在真实的异步推理循环里跑,replay buffer 里存的轨迹,天然带着异步执行才有的时间关系。这样训练和部署面对的是同一套物理规律,不存在"训练时顺拐、部署时对不上"的落差。 |
▌ FIG.01 · 三条并行泳道:感知 / 规划 / 执行互不等待,梯度只穿执行区 |
▌ PART 03 · 取舍 · 和同步RL、模仿学习比,SmoothRL 拿什么换什么 用"只改一小段残差"换实时性,用"稀疏成功/失败信号"换工程可行性 先跟两条更早的路线摆在一起看。传统同步 RL 的假设是"模型算、机器人做、再更新"三步严格顺序发生,credit assignment 天然干净——但代价是机器人必须在每次推理之间等待,模型越大、推理越慢,卡顿就越明显,高动态任务(比如投掷)根本撑不住这种停顿。模仿学习(behavior cloning)走的是另一条路:直接让策略模仿人类示范轨迹,不需要在线试错,天然兼容异步执行的时间节奏——但它优化的目标是"像不像示范",不是"任务有没有成功",遇到基础策略自带的系统性偏差(比如投掷时释放速度没跟距离联动、切胶带的刀片持续往一侧偏)时,模仿学习没有一个基于结果的反馈信号去主动纠正这类偏差,只能等更多、更精细的示范数据去覆盖。 SmoothRL 选的是第三条路:保留在线 RL"用结果纠偏"的能力,但把训练成本压到最低——冻结体量最大的基础策略(π0.5)不动,只用一个轻量的 TD3-style actor-critic 学一段残差修正,相当于不重新教机器人"这件事该怎么做",而是在它已经会做的基础上,专门去抠"差在哪几毫米、差在哪半拍"。这个设计换来的是样本效率:星尘团队在真机上测试的三项任务里,动态投掷从 39% 提升到 94%、给笔戴帽(约 5mm 位姿容差)从 8% 提升到 83%、快递开箱(约 1mm 宽刀片插入 2—3mm 接缝)从 30% 提升到 90%,累计只用了两三百个 rollout episodes——这是残差策略而非端到端重新训练才可能达到的效率。代价也很明确:残差修正的能力上限,被冻结的基础策略框死了。论文原文直言,如果基础策略本身离目标行为太远,局部 residual correction 并不能凭空把它救回来——SmoothRL 解决的是"从基本会到足够准",不是"从不会到会"。 还有两处需要如实说明的边界。第一,当前用的是稀疏的任务成功/失败奖励,训练过程中操作员可以在必要时介入纠正,介入动作本身也会进入后续训练——这意味着 SmoothRL 目前还不是完全无人参与的"自主进化",而是一套更高效的、面向真实部署的在线后训练机制。第二,快递开箱任务的学习曲线并非一路上扬:累计 150 个 rollout episodes 时成功率一度从 30% 回落到 20%,随后才回升到 40%、最终到 90%——真实世界里的在线探索不保证单调变好,这也是在线 RL 比离线模仿学习更"贵"的地方:它需要机器人在真实环境里持续试错,试错本身有成本和风险。作为补偿,团队在策略里加了平滑性约束:一次真实自主投掷 rollout 中,末端执行器加速度均方根下降 52%,急动度(Jerk)下降 47%——机器人不仅成功率更高,动作也更连续,不再靠"猛冲一下再急刹"去凑数。 |
▌ FIG.02 · 三条路线的取舍对比:谁负责"纠偏",谁扛"实时性"代价 |
▌ PART 04 · 坐标 · "异步执行+实时性"这道题,全球玩家给出了几种不同答案 星尘的独特之处不是发现了问题,而是把系统工程细节公开写透了 先说明星尘智能这家公司:成立于 2022 年 12 月,总部深圳,核心团队最初由 6 名成员组成,均来自腾讯 Robotics X 实验室。技术架构上,星尘对外的说法是"AI模型-具身OS-绳驱本体"全栈布局:基座模型系列叫 Lumo,本体是绳驱(cable-driven)双臂人形机器人 S1,据公司公开资料,其末端执行器速度可达 10m/s 以上、重复定位精度 ±0.1mm、单臂负载 5kg,官方称是"全球首个且唯一实现绳驱 AI 机器人量产"的公司(这组硬件参数为企业自述口径,未见独立第三方基准复核)。融资节奏也很快:据南方财经、新浪财经、深圳新闻网等多家财经媒体 2026 年 6 月报道,星尘智能完成 B 轮系列融资超 10 亿元人民币,是三个月内的第三轮融资,估值据报道突破百亿元人民币,A/A+/A++ 轮由蚂蚁集团连续三轮领投——星尘是未上市公司,具体估值口径以企业与投资方后续正式披露为准,本文不构成投资建议。9 月 2 日,星尘还宣布引入前字节跳动强化学习专家、前腾讯 Robotics X 智能体中心负责人孙鹏博士,扩充 RL 后训练团队,SmoothRL 正是这条强化学习后训练主线上的最新产出。 把视野拉到全球,"模型算得慢、机器人不能停"这道题,几家头部公司给出的是完全不同的解法。Physical Intelligence(π0/π0.5 的开发方)走的是纯推理时路线,叫 Real-Time Chunking(RTC):不训练、不涉及奖励信号,靠一种引导式的流匹配(flow matching)算法,让新算出来的 chunk 在数学上主动去贴合上一段 chunk 里已经执行掉的那部分轨迹,从而在衔接处做到平滑——本质是"用推理时的算法技巧把接缝缝顺"。Boston Dynamics 的 Atlas(2026 年 1 月发布量产版,与现代汽车合作落地产线)用的是另一条路:大规模仿真里的强化学习加遥操作示范,训练出一套统一的全身控制策略,追求"零样本"(zero-shot)直接搬到真机上——学习完全在仿真里完成,部署后不再依赖真实世界的在线试错回路。Figure AI 的 Helix(2026 年 1 月更新为 Helix 02)用的是分层拆分:S2 负责慢速语义规划,S1 负责较快的全身动作生成(200Hz),H02 还新增了 S0 层专司更高频(1kHz)的平衡与接触控制——至少三套不同节奏的网络协同工作,而不是靠单一系统里的 chunk 切分来处理时间错位。1X 的 NEO 干脆换了个赛道:不在算法层面死磕实时性,而是靠 2 万美元定价 + 大规模家庭场景遥操作数据收集,用数据规模去喂饱模仿学习,用"人类先远程操作、机器慢慢学"的方式积累通用能力。 这样排开就能看清楚:SmoothRL 和上述几条路线都不冲突,反而更像是补在"训练阶段+真实反馈"这个格子里的一块拼图——RTC 解决的是推理时的平滑衔接,不涉及策略本身的权重更新;星尘解决的是训练时如何用真实执行结果去修正策略权重本身,两者理论上可以叠加使用(星尘论文原文也提到,下一步计划探索异步执行与生成式策略端到端优化的结合)。值得一提的是国内视角:国内具身智能创业公司的公开叙事,目前更多还是聚焦在本体硬件的展示上——灵巧的手部动作、舞蹈、极限运动这类适合传播的演示居多,把在线 RL 系统工程的具体设计细节(哪一帧算执行、梯度怎么回传、训练和部署怎么对齐)完整写成技术报告并公开挂到 arXiv 的案例并不多见。星尘这次把三区域切分的具体帧数、TD3 残差结构、"Reinforce in Deployment"的训练范式都摊开写清楚,这种系统工程细节的公开化程度,在当前国内具身智能公开资料里还比较少见——这本身也是本文选择拆解它的原因之一。 |
▌ FIG.03 · 全球格局定位:同一道实时性难题,五条不同的解法路径 |
▌ 四条实时性方案对照:不是竞争关系,是解决同一问题的不同层面 依据 arXiv:2608.29768、量子位报道、Physical Intelligence 官网 pi.website/research/real_time_chunking、Boston Dynamics 官方博客与 Figure AI 官网公开资料整理 |
▌ SmoothRL 关键事实(口径已标注来源) 1. 发布:2026 年 9 月 2 日科技日报、9 月 4 日量子位相继报道,星尘智能(Astribot)基座模型团队发布异步在线强化学习框架 SmoothRL,同步公开 arXiv 技术论文(arXiv:2608.29768,提交于 2026 年 8 月 30 日) 2. 核心机制:每个生成的 action chunk 按帧号切分为已提交(committed)、执行(execution)、丢弃(discarded)三个区域,价值梯度只穿过执行区域回传,确保优化目标与机器人真实经历的轨迹分布一致(arXiv 摘要原文) 3. 具体参数:星尘 S1 以 30Hz 执行动作、5Hz 频率发起推理请求(每 200ms 一个新 chunk);基础策略(微调版 π0.5)每次预测 32 帧,固定延迟预算下 Committed+Execution 共占 12 帧,其中仅 6 帧为本轮真正执行的 Execution Region,其余 20 帧在执行前被下一轮 chunk 覆盖丢弃(量子位报道援引星尘技术报告) 4. 算法范式:value-gradient paradigm,直接用动作价值函数对动作求梯度反传更新策略参数;具体实现中基础策略 π0.5 冻结,沿用 RLT 骨架,用轻量 TD3-style actor-critic 在原始动作空间预测残差修正(arXiv 摘要+量子位报道) 5. 训练范式:"Reinforce in Deployment"——训练 rollout 本身就在真实异步推理循环下运行,replay buffer 记录的是异步执行下产生的真实轨迹,而非先同步训练再异步部署(量子位报道) 6. 真机任务效果:动态投掷成功率 39%→94%(累计250个rollout episodes);给笔戴帽(约5mm位姿容差)8%→83%;快递开箱(约1mm宽刀片插入2—3mm接缝)30%→90%,其中开箱任务学习曲线非单调,累计150轮时一度从30%回落至20%(量子位报道) 7. 平滑性指标:一次真实自主投掷rollout中,经在线RL后末端执行器加速度均方根下降52%、急动度(Jerk)下降47%(量子位报道) 8. 已知边界:当前使用稀疏任务成功/失败奖励,训练中操作员可介入纠正;要求chunk级推理必须在预设latency budget内完成;轻量残差策略的表达能力受冻结基础策略上限约束,基础策略过差时无法凭空救回(量子位报道原文表述) 9. 团队:项目负责人王佳楠,共同第一贡献者高广、农宇轩,黄百富参与研究;技术报告见 astribot.com/en/research/SmoothRL(量子位) 10. 公司背景:星尘智能(Astribot)2022年12月成立于深圳,核心团队最初6人来自腾讯Robotics X实验室;2026年6月完成B轮系列融资超10亿元人民币,为三个月内第三轮融资,估值据报道突破百亿元,A/A+/A++轮由蚂蚁集团连续三轮领投(南方财经、新浪财经、深圳新闻网等多家财经媒体报道;星尘智能为未上市公司,估值以官方正式披露为准,本文不构成投资建议) 11. 硬件本体:S1为绳驱双臂人形机器人,据星尘官方公开资料,末端执行器速度≥10m/s、重复定位精度±0.1mm、单臂负载5kg、全向轮式底盘(企业自述参数,未见独立第三方基准复核) 12. 团队扩充:2026年9月2日星尘智能宣布引入前字节跳动强化学习专家、前腾讯Robotics X智能体中心负责人孙鹏博士,扩充机器人强化学习与后训练团队(科技日报、量子位) 13. 说明:本文所有数字引自 arXiv 论文摘要、量子位/科技日报报道及多家财经媒体对星尘智能融资情况的报道,已标注口径来源;星尘智能为未上市公司,本文仅分析技术工程机制,不构成任何投资建议 |
▌ AI翻译局 洞察 SmoothRL 真正解决的不是"机器人会不会某个动作",而是"异步部署下,在线学习该向谁问责"这个信用分配问题。三区域切分(Committed/Execution/Discarded)加"只让梯度穿过执行区",本质是把一套原本只在理想同步世界里成立的强化学习假设,重新对齐到机器人真实经历的异步轨迹上——这是工程细节,但决定了训练出来的策略是否真的对得上部署时的物理现实。 这不是一条能单打独斗的技术,而是一块可以和其他路线拼接的模块。它跟 Physical Intelligence 的 RTC 解决的不是同一层问题——RTC 管推理时的平滑衔接,SmoothRL 管训练时的权重修正,两者不冲突。它也不否定 Boston Dynamics 的仿真优先路线或 1X 的数据规模路线,只是提供了另一种答案:当你已经有一个基本能用的基础策略、又拿不出海量新数据去重新训练时,用少量真实 rollout 加在线 RL 去抠掉最后的系统性偏差,可能是性价比更高的选择。 需要提醒的是,当前 SmoothRL 仍依赖稀疏奖励和人工介入,还不是完全自主的进化闭环;硬件参数(10m/s、±0.1mm)为企业自述口径,融资与估值数字引自多家财经媒体报道,星尘智能为未上市公司,本文不构成投资建议,也不构成对其技术领先性的排他性判断。 |
▌ 需继续观察 · SmoothRL 目前仅在三项真机任务上验证,能否泛化到更广泛的操作任务分布,团队自己也列为下一步方向 · 论文提到的"更大范围策略更新"与"异步执行+生成式策略端到端优化"的结合,目前还停留在计划阶段,尚无公开结果 · 当前依赖稀疏成功/失败奖励+人工介入,距离完全自主的在线进化闭环还有多远,值得持续跟踪 · 星尘 S1 的硬件参数(末端速度、重复定位精度)为企业自述,是否有独立第三方基准评测,暂未检索到公开信息 · Physical Intelligence的RTC与星尘的SmoothRL能否实际叠加使用,目前只是论文里提到的设想,未见落地验证 |
▌ 如何查证 · arXiv 论文:arxiv.org/abs/2608.29768 · 星尘官方技术报告:astribot.com/en/research/SmoothRL · 量子位报道:qbitai.com/2026/09/484437.html · 科技日报报道:stdaily.com/web/gdxw/2026-09/02/content_573826.html | ▌ 延伸边界 · 这是一项研究性工程成果,暂无面向开发者/企业的公开API或试用入口 · 三项验证任务规模有限,尚不构成"通用异步在线RL已解决"的结论 · 硬件参数、融资估值均为企业及媒体自述口径,未见独立第三方复核 · 阅读前建议先理解 action chunking / 异步推理的基本概念,避免被"机器人学会新技能"式标题误导 |
END OF NOTE 087 AI翻译局 · 星尘智能 SmoothRL 异步在线强化学习拆解 把术语翻译成判断,把判断翻译成行动 |