6 Matching Annotations
  1. Jun 2026
    1. this tradeoff between compute and coverage is important, because it makes the quality of this axis of risk assessment scale with compute, rather than the manual effort required to build more evaluations

      这句话是整篇论文里最具战略意义的表述。传统安全评估的瓶颈是人力:需要安全研究员手动设计测试场景、构建评测集、维护更新。Deployment Simulation把这个瓶颈转移到了算力——模拟更多对话,就能发现更多潜在问题。这意味着安全评估的质量可以随着算力的增加而提升,而不是随着人力的增加。在算力持续降价的趋势下,这是一个非常重要的可扩展性属性。

    1. Coding agents do not fully utilize robot resources when they are reading logs, writing code, debugging, or waiting for the language-model backbone

      这个发现揭示了一个尚未解决的效率问题:物理资源(机器人)和计算资源(GPU)被智能体的思考时间浪费了。智能体在阅读日志、写代码、等待LM响应时,机器人闲置。这与多处理器计算中的同步开销是同一个问题的变体——如何让智能体的认知周期和物理执行周期更好地交叉重叠,是这类系统真正走向规模化的关键工程挑战。

    1. scientists can only test the molecules they can make or otherwise obtain

      这句话概括了整个药物发现领域最核心的约束:化学可及性是速度限制步骤。我们可以用计算方法预测数十亿个可能有效的分子,但如果合成路线不存在或产率太低,这些分子永远停留在虚拟空间。Chan-Lam偶联的磺酰胺版本产率从偶尔有用到可靠有用,意味着一类此前在实践中被放弃的分子结构重新进入了可探索的空间——这才是本文真正的影响力所在。

    1. Once human- and AI-authored code quality reach parity, humans will stop writing code entirely, and shift to only reviewing it. But if they can't review code as quickly as Claude can generate it, human review will become the bottleneck to AI development.

      这是全文逻辑最严密的段落,也是Amdahl法则的精确应用。加速流水线中最慢的环节决定整体速率,当AI生成代码的速度超过人类审查速度,人类就成了AI进化的瓶颈。这不是抽象担忧——Anthropic在脚注中已经承认「人类代码审查已经成为新瓶颈」。出路只有两条:要么AI能自己审查自己的代码(全闭环递归),要么大幅减少对人类审查的依赖。这两条路都指向同一个终点:递归自我改进。

    2. Once human- and AI-authored code quality reach parity, humans will stop writing code entirely, and shift to only reviewing it. But if they can't review code as quickly as Claude can generate it, human review will become the bottleneck to AI development.

      这是全文逻辑最严密的一个段落,也是Amdahl法则的精确应用。加速流水线中最慢的环节决定整体速率,当AI生成代码的速度超过人类审查速度,人类就成了AI进化的瓶颈。这不是抽象担忧——Anthropic在脚注中已经承认「人类代码审查已经成为新瓶颈」。出路只有两条:要么AI能自己审查自己的代码(全闭环递归),要么大幅减少对人类审查的依赖。这两条路都指向同一个终点:递归自我改进。