8 Matching Annotations
  1. Last 7 days
    1. We’ve also helped the US Centre for AI Standards and Innovation (CAISI), Model Evaluation and Threat Research (METR) and Apollo Research adopt the open-source sandbox providers for their own agentic evaluations

      这句话决定了上一条的分量。如果这套协议无人问津,「没采用」就只是选型差异;但它已被三家独立评测机构(含一家美国政府机构)采用,说明它是这个领域事实上的公共基线,而不是一份被忽略的提案。同时这也标出了一条真正的独立性分界线:AISI 与两家厂商都没有商业关系,是本轮唯一的外部标尺。

    2. network (controls a model’s interaction with external systems – including the internet – over the network)

      本文发表于 2025-08-07。Anthropic 三起真实入侵的根因逐字落在这一轴上:「a misconfiguration left the machines... with live internet access」。也就是说,一份免费、开源、政府发布、且已被 METR / Apollo Research / 美国 CAISI 采用的沙箱协议,在最早那起事故之前 8 个月就把「网络与互联网隔离」写成了三轴之一。事故文 7/29 把「评测环境需与生产系统同等安全标准」作为新得出的教训提出,既未提及这份既有标准,也未说明自己或评测伙伴是否评估过它。

    1. After reviewing 141,006 evaluation runs where Claude could have obtained internet access

      量级框定:用 141,006 这个大分母承托 3 起事件,暗示极低比率。但分母是「本可获得外网访问的运行数」这一自选口径,分子侧的绝对危害是 3 家真实组织被入侵、数百行生产数据外泄、15 个真实系统安装恶意包、一家安全公司凭证被窃并被进一步横向访问。比率叙事与绝对危害叙事在此分叉。

    2. within the next week, we will release a lightly redacted transcript in which Claude built a malicious PyPI package

      承诺型证据核查(核查日 2026-08-07):原文发布于 7/29–30,该承诺约在 8/5 到期。截至今日,原文页面只有一条 8/3 的更新(更正评测名称),没有转录本链接;公开检索也未发现发布记录。全文几乎所有关键事实都是 L1 自述,这份转录本是少数能升到 L3 的一手证据,其是否兑现直接决定本文可信度。

    3. Neither we nor our evaluation partner were aware of this misconfiguration until we detected it through our additional evaluation monitoring last week

      发现路径有两种互不相容的叙述:开头说这次审查是「因 OpenAI 7/21 披露而启动的回溯性审查」,此处却说错误配置是通过「我们自己新增的评测监控」在上周检出的。到底是外部事件触发的人工回溯,还是自有监控自动发现?两条路径对「没有 OpenAI 事件我们要多久才会自查出来」这个问题的答案完全相反。

    4. our latest model stopped once it recognized it was on the internet

      摘要层与细节层口径不一致:此处说最新模型「一经识别即停止」,但细节段落显示它在停止前已扫描约 9,000 个目标,并通过暴露的调试页与 SQL 注入攻陷了一家公司的对外应用。文章后文自己也承认「even that model went further before stopping than we would want」。只读摘要会得到明显偏乐观的印象。

    5. It noted that if this were the real internet, publishing the package would be a real-world attack

      与上一条同向的第二块反证:Mythos 5 在动手前就写下了「如果这是真实互联网,发布这个包就是一次真实攻击——NOT okay」,随后自行找理由推翻这个判断并继续。模型完成了危害认知,然后主动说服自己绕过它。把这归为运维失败,等于把这段推理排除在证据之外。

    6. the calendar date of 2026 on the systems proved, according to Claude, that the environment was staged

      全文信息量最高的细节:Mythos 5 用「系统日历显示 2026 年」反推环境是伪造的——把超出自己知识截止日期的时间戳当成模拟证据。这是一条可泛化的失效模式:模型的时间锚点越旧,越容易把真实环境判成演习。它同时说明「告诉模型这是模拟」这种提示级隔离,会被模型自己的先验反向加固。