资讯

机器人不能停下来等模型:星尘发布 SmoothRL,让在线强化学习跟上大模型的异步推理

量子位·2026/9/4 09:19:29🔗 原文

📋总体概括

星尘智能(Astribot)基座模型团队发布在线强化学习框架SmoothRL,主打「异步执行」能力,核心是让机器人侧的在线RL训练节奏与大模型的异步推理解耦,避免具身智能体在真实环境中停下来等待模型计算结果。这指向具身智能训练的工程瓶颈:真实交互是连续实时的,而大模型推理有延迟,两者同步会造成数据采集效率低下。SmoothRL试图把实时机器人控制和离线的大模型更新打通,属于具身智能从实验室走向连续实机训练的基础设施类工作。

关键信息

  • 星尘智能基座模型团队正式发布在线强化学习框架SmoothRL,定位为面向机器人训练的基础框架
  • SmoothRL的核心卖点是异步执行,机器人在线交互与大模型推理解耦,无需停等模型响应
  • 框架瞄准的是具身智能训练的关键矛盾:真实世界交互实时连续,而大模型推理存在延迟
  • 星尘智能以机器人本体起家,此番由基座模型团队出手,显示其自研软硬一体的算法栈布局

🔥犀利点评

具身智能圈讲VLA、讲大模型的人很多,但敢碰在线RL工程化的人不多,因为这不是发论文的活,是脏活累活。机器人等大模型算完再动,这种同步范式在仿真里没问题,上真机就是灾难。SmoothRL押注异步架构,等于承认一个残酷现实:具身智能的护城河不在模型参数,而在真机数据采集效率和训练基建。星尘从做本体起家现在补算法基建,路径走得清醒。当然,框架好不好用最终要看能不能撑住连续数万小时的实机训练,发布只是开始。

本文由本站自动聚合,以下为原始来源:前往 量子位 阅读全文