3 Matching Annotations
  1. Jun 2026
    1. The full process took three months, from the first prompt on March 4th to sharing the OAI-M1-03 results with independent experts on June 4th

      三个月从提示词到同行评审——这是非常具体的时间锚点。传统药物化学研究从假设提出到验证发表,通常需要数月到数年。更短的假设-验证循环意味着研究者可以在同样时间内探索更多方向,从而从根本上改变科学发现的经济学。值得追踪的问题是:随着下一代模型和更自动化的工作流,这个三个月会压缩到多短?

    1. By April 2026, Claude Mythos Preview was achieving ~52x. For calibration, a skilled human researcher would need four to eight hours to reach 4x.

      代码优化任务:从2025年5月的~3x到2026年4月的~52x,一年内提升17倍。基准线:顶尖人类研究员4-8小时能达到4x。Mythos Preview在这个任务上比最优秀的人类快了约13倍。脚注7提醒绝对倍数依赖起始代码的优化空间,因此重要的是同条件下的对比而非绝对数字——执行层意义上的超人编程能力已经实现。

    2. By April 2026, Claude Mythos Preview was achieving ~52x. For calibration, a skilled human researcher would need four to eight hours to reach 4x.

      代码优化任务:从2025年5月的~3x到2026年4月的~52x,一年内提升17倍。基准线:顶尖人类研究员4-8小时能达到4x。也就是说Mythos Preview在这个任务上比最优秀的人类快了约13倍,同时消耗的时间可能只有人类的几分之一。脚注7提醒绝对倍数依赖起始代码的优化空间,因此重要的是同条件下的对比而非绝对数字——但这个框架下的对比结论已经足够震撼:「执行层」意义上的超人编程能力已经实现。