6 Matching Annotations
  1. Last 7 days
  2. Jun 2026
    1. Scaling the robot fleet drives higher token consumption: as more agents read logs, summarize peer branches, and coordinate, the total token budget required to reach a successful policy grows with fleet size

      这是一个关于多智能体扩展的微妙发现:机器人数量增加,总token消耗也增加——主要来自智能体之间的协调开销(阅读彼此的日志、总结peer分支)。更大的团队更快到达成功,但边际收益递减,而边际成本递增。这与人类研究团队的规模化规律惊人地相似:超过某个规模后,协调成本开始主导生产成本。

    2. Coding agents do not fully utilize robot resources when they are reading logs, writing code, debugging, or waiting for the language-model backbone

      这个发现揭示了一个尚未解决的效率问题:物理资源(机器人)和计算资源(GPU)被智能体的思考时间浪费了。智能体在阅读日志、写代码、等待LM响应时,机器人闲置。这与多处理器计算中的同步开销是同一个问题的变体——如何让智能体的认知周期和物理执行周期更好地交叉重叠,是这类系统真正走向规模化的关键工程挑战。

    1. Maria ran a total of 10,080 reactions – more than a chemist running three reactions every day would run in a decade

      这个数字是理解本文意义的关键。10,080个反应——一个化学家每天做3个实验需要十年。规模本身就是科学贡献:统计功效足够大,才能在嘈杂的化学数据中区分真实信号(TEMPO的效果)和随机噪声。在没有自动化实验室的情况下,这类规模的系统探索在经济上几乎不可能——AI不只是提出了假设,还使验证这个假设变得可行。

    1. When we applied the top AAR-discovered ideas to a production-scale w2s run, we observed only +0.5pt improvement in a noisy floor, suspected to be an elicitation failure

      论文里最诚实的一段。实验室环境的PGR=0.97迁移到生产规模后几乎消失,作者诊断为引发失败——能力在那里,但我们不知道如何正确唤起它。这个失败模式极具代表性:小规模验证和大规模部署之间存在我们目前不完全理解的鸿沟。在对齐研究语境里这尤其危险:一个技术在对照实验中有效,并不保证在实际部署中有效。