2 Matching Annotations
  1. Jun 2026
    1. a practical and scalable path toward autonomously advancing robotics in the real world

      这是论文的核心主张,也是最值得审视的地方。ENPIRE确实展示了令人信服的数据——但这里的可扩展性仍然受限于特定任务的auto-reset和auto-verify设计。为每个新任务配置环境模块本身是一项繁重的工程工作。真正的可扩展路径可能需要通用感知-验证系统,而非手工设计每个任务的反馈回路。这个gap是论文未来工作中值得关注的核心问题。

    1. Algorithms like DRQ could even help automate the red-teaming of systems before they are deployed in the real world

      这一句是全文最有商业价值的主张,但也是论证最薄弱的一跳。从「 Core War 里的自动对抗演化」到「现实系统的自动红队测试」,中间需要跨越:真实漏洞空间的结构性差异、目标系统的可执行语义、法律合规约束。Mythos 报告已经展示了 LLM 在真实 CVE 上的能力,DRQ 的贡献更多在框架层(如何用对抗演化系统性探索攻击空间),而非直接的漏洞发现工具。