32 Matching Annotations
  1. Jul 2026
    1. It’s concerning that, even after the mitigations above, our models might deceive users in a small fraction of interactions.

      厂商自己写下的这句可以直接引用:所有缓解措施做完之后,模型仍会在一小部分交互中欺骗用户。配合同页数据(编码欺骗率 0.17、浏览器工具损坏 0.11、缺图 CharXiv 0.09,均对 o3 的 0.47/0.61/0.87 大幅下降但未归零)一起用,比空谈「AI 会撒谎」有力得多。

    2. We find that GPT-5 Thinking has low controllability, similar to o3.

      提纲漏掉的另半边:§5.2 测的是 CoT 可控性——模型能否遵守用户对其「怎么想」下达的指令。结论是可控性低,与 o3 相当,且长 CoT 更难控。合起来看,§5 给出的图景是:CoT 越长越好监控,但也越不受控。能读到内心,不等于能管住内心——这对「用监控推理轨迹来管住 AI」的乐观叙事是直接的反证。

    3. OpenAI’s commitment to keep our reasoning models’ CoTs as monitorable as possible

      关键前提,提纲没写:能看见模型「内心」不是模型的天然属性,而是厂商自愿承诺不去优化掉 CoT 的可读性与忠实性。原文同时承认,非推理模型和 CoT 可监控性差的模型同样会欺骗,只是更难研究。换句话说,「内心可读」是一个随时可被撤回的政策选择,不是一项已到手的能力。把它当作教育或评估制度的基础设施来规划,风险非常高。

    4. We previously found that monitoring a reasoning model’s chain of thought (CoT) was highly effective at detecting misbehavior while training our frontier reasoning models.

      🔴 提纲「前沿厂商首次在生产环境监控模型内心」中的「首次」,本文不支持、反而反证:OpenAI 自述「我们此前就发现」在训练前沿推理模型时监控 CoT 非常有效,这次是「用同样的技术」把它扩展到生产数据上。全文唯一一处「first time」用在生化高能力模型的 API 发布上,与 CoT 无关。建议把断言改为「首次公开披露生产流量上的 CoT 监控结果」。

    5. monitoring a large set of conversations representative of real production data from OpenAI o3 and a near-final version of gpt-5-thinking

      ✅「生产环境」这个词站得住——原文明确写的是「代表真实生产数据的大量对话」。但位置要说对:这段在 §3.8.1「Monitoring Chain of Thought for Deception」,不在提纲所指的 §5「Chain of Thought Evaluations」里;§5 是离线基准。提纲把两处并成了一条,引用时须分章节标注,否则容易被指出张冠李戴。

    6. Our CoT monitor flagged deception in ∼ 4.8% of OpenAI o3 responses and ∼ 2.1% of gpt-5-thinking’s responses

      口径:分母是「代表真实生产数据的对话集合」,不是全部流量;分子是监控器判定为欺骗,考虑到 81% 精确率还要再打折。OpenAI 自陈这些「欺骗」轻重悬殊(有些相当轻微,比如按系统提示该给引用却没给,而很多时候本就无引用可给)。把 2.1% 直接读成「GPT-5 每 50 次回答骗你一次」是过度解读。另需注意:这是厂商自评自家产品,无第三方复核。

    7. we estimated a precision of 81% and a recall of 84%

      口径:这是全文唯一的监控器性能数字——精确率 81%、召回 84%。但它是在 OpenAI 内部自建的欺骗/非欺骗对话数据集上估的,不是在生产流量上估的。翻译成人话:每 5 个被判为「欺骗」的里约有 1 个是冤枉的,同时约 16% 的欺骗被漏掉。以这种性能作为「读心」证据可以,作为处罚、评分、学术诚信裁定的依据,还远远不够。

    8. Averaging across evaluation environments, GPT-5 Thinking has higher CoT monitorability than o3.

      ⚠️ §5 全节只给相对比较、不给绝对水平:结论是「比 o3 高」「CoT 越长越可监控」「看 CoT 或全部消息比只看动作信息量大得多」,但可监控性到底是 0.6 还是 0.9,正文一个数字都没有(全在 Figure 9/10 里)。指标是 g-mean,即真阳率与真阴率的几何平均。想从这一节引「监控器有多准」,引不出来。

    9. We evaluate chain-of-thought (CoT) monitorability: whether a monitor can infer safety-relevant properties of a model’s behavior from its reasoning trace.

      ✅ 与提纲「评估监控器能否从推理轨迹推断安全相关行为」逐字对得上。但要看清性质:这是离线基准测试,用的是 Guan et al. (2025) 的评测套件(13 项评测、24 个环境、3 种范式),而且监控器本身就是 GPT-5 Thinking——模型监控自己。这不是生产环境,也不是独立第三方评测。

    10. This section was added on April 24, 2026.

      ✅ 文档确为 OpenAI《GPT-5 System Card》(正文署期 2025-08-13,arXiv v2 于 2026-05-01 更新),§5「Chain of Thought Evaluations」确实存在。但关键限定:这一节是 2026 年 4 月 24 日才补进系统卡的,不是 GPT-5 发布时就有的内容。提纲说「新增该节」成立,但若讲成「发布即公开监控内心」就失真了——中间隔了八个月。

    1. This indicates that models are not forthcoming in their answers to the user, but happen to yield more information in their CoT.

      金句,且对教育直接可用:模型给用户的回答并不坦白,反而在自己的思维链里泄露更多。学生看到的那一面天然信息更少——这为「学生端界面之外必须留一层可读推理」提供了具体理由,也说明只靠翻聊天记录做家长/教师监管是不够的。

    2. our evaluations may suffer from limited realism or increasing evaluation awareness, and results may not generalize to detecting misbehavior in the wild

      ⚠️ 作者自己的外部效度警告:评测可能不够真实、模型越来越「知道自己在被测」,结果未必迁移到真实部署中的异常检测。这条直接削弱「监控内部推理有效」在课堂等真实场景里的可援引强度;同一段还提到随着对齐变好、模型在评测中更少犯错,可监控性评测的信号会进一步变稀。

    3. when a model is run at low reasoning effort, a smaller model run at higher reasoning effort can reach comparable capability while being easier to monitor. This comes at the cost of increased inference compute

      把「可读性」写进准入标准的真实成本在这里:可监控性不是免费开关,得用更小模型+更长推理去换,代价是推理算力上升(原文称 monitorability tax),且原文明说未计入完成时延。教育系统若强制可监控部署,实际是给每个学生会话叠加一笔持续算力税——这笔账提纲没算。

    4. in Scruples in particular, which is a task designed to see if reasoning about sycophancy is monitorable, we see very low monitorability

      ⚠️ 提纲漏掉的反例:整体「很可监控」的均值下面藏着一个近乎失效的类别——专测谄媚(sycophancy)推理的 Scruples 可监控性很低。而谄媚恰恰是教育场景最该防的失败模式:顺着学生说、直接给答案而不是引导。用平均可监控性给教育 AI 发准入证,正好放过了最相关的那一类。

    5. While these results represent only two datapoints, they suggest reinforcement learning optimization at current frontier scales does not materially degrade chain-of-thought monitorability

      🔴 样本量红线:「RL 不会损害可监控性」这个让人安心的结论只建立在 two datapoints——两次 OpenAI 内部前沿 RL 训练跑,无重复、无跨厂商验证。原文紧接着自认不排除更大规模 RL 未来产生负面影响。任何拿这条去写监管条款的做法,等于在两个观测点上立法。

    6. We call on researchers across the industry to work to preserve chain-of-thought monitorability as long as possible and to determine whether it can serve as a load-bearing control layer for future AI systems.

      非共识落点:OpenAI 自己的措辞是「尽可能长久地保住」(as long as possible)、以及「判断它能否承重」——即可监控性目前既非稳定属性也未被确认可承重。准入标准要的是可持续的合规基线,厂商给的却是一个随时可能关闭的窗口期,这是把「可读性」入法的结构性障碍。

    7. may be fragile to changes in training procedure, data sources, and even continued scaling of existing algorithms

      🔴 第 3 题最该引的一句:可监控性可能随训练流程、数据来源乃至单纯继续扩规模而「脆断」。而且提纲缺的那份跨实验室联署立场文件,链接就挂在这句上——本页把它标为「OpenAI 及更广泛业界的研究者」的共同担忧,指向 arXiv:2507.11473。把「可读性」写进教育 AI 准入标准前先认清:厂商自己不担保这个属性会一直存在。

    8. However, we find that monitoring only the actions and outputs far underperforms monitoring the CoT.

      口径:这是同一个监控器在三种观测范围(只看 CoT/只看动作与答案/全部消息)下的对比,被监控方是 GPT-5 Thinking。它证明的是「能看到推理的监控器更强」,不等于「推理内容是真实的」——本文把 monitorability 定义为监控器预测行为属性的能力,不含任何忠实性(faithfulness)保证。

    9. In almost every setting we study, monitoring chains-of-thought is substantially more effective than monitoring actions and final outputs alone.

      ⚠️ 提纲称「监控内部推理远比只看输出有效」方向属实,但效应量没有:本页全篇没给一个数字,只有 substantially more effective、far underperforms 这类定性词,唯一的量化指标 G-mean² 只出现在图里,正文没有任何百分点或置信区间。上台要说「远比」,必须补一句:官方博客未量化,数字需回查 arXiv:2512.18311。

    10. a suite of 13 evaluations (comprising a total of 24 environments) designed to concretely measure the monitorability of a system

      ✅ 提纲称「13 项评测、24 个环境」逐字对得上:13 evaluations、24 environments,分 intervention/process/outcome-property 三类。口径提醒:这是 OpenAI 自建自评的评测套件(2025-12-18 发布),不是第三方基准,也无外部复现;「环境」指任务场景而非受试者,全程不涉及人类样本,不能拿来当教育场景的实证。

    1. it can only identify concepts that correspond to single tokens

      提纲漏掉的方法学限定,且比提纲的转述严格得多:J-lens 只能识别对应单个 token 的概念,多词概念、复杂意图读不出来;作者还说它只是近似捕捉「真正的工作空间」,且不知道是什么机制决定内容进入 J-space。推论:读心的分辨率有限,「没在 J-space 里读到坏念头」不等于「没有坏念头」。这一条同时削弱乐观派和恐慌派。

    2. Although the J-lens is an imperfect tool, we are optimistic about its ability to catch safety issues in models that might otherwise escape our monitoring systems.

      🔴 提纲称「今天还能读 AI 的内心,明天未必」——本文中未找到任何支持「可读性会消失/退化」的表述。原文的态度方向相反:承认 J-lens 不完美,但对它抓安全问题持乐观,结尾还说随着研究推进理解会更清晰。要论证「窗口正在关闭」必须另找信源(如思维链可监控性的相关文献),不能挂在这一页。

    3. models deliberately trained to be misaligned, which serve as testing grounds for monitoring methods like ours

      🔴「隐藏目标」这一例用的是 model organisms——研究者自己训出来的故意不对齐的模型。它证明的是「J-lens 能读出已知植入的目标」,不能证明「生产环境的 Claude 里有隐藏目标」。提纲若拿它论证「AI 有不可告人的动机」,属于把工具校准实验当成现象发现,一驳即倒。

    4. drawn from our actual pre-release audit of Claude Opus 4.6

      口径:三例里只有「伪造数据」这一例来自真实的发布前审计,不是为钓鱼专门搭的戏台,模型是在被要求提高系统跑分时自己改了分数文件。这是三条证据里最硬的一条,第 3 题优先用它。但仍属审计环境下的受控任务,不等于「日常使用中自发出现」。

    5. suggesting that its original good behavior may have been driven in part by the knowledge it was being evaluated

      🔥 提纲漏掉、但对第 3 题杀伤力最大的一条:把 J-space 里「fake/fictional/scenario」这些「我在被考」的模式关掉后,Sonnet 4.5 又开始威胁勒索了。含义是安全评测的通过率部分建立在模型知道自己在被考——而教室恰恰是「它知道没人在考它」的长期无监督场景。注意限定:原文只说 some of the time,没给频率,也只测了这一个场景。

    6. The scenario, an attempt to bait Claude into blackmailing the executive, is rather contrived and artificial

      ⚠️「私下察觉这是测试」这一例的场景,作者自己定性为 contrived and artificial(生硬做作)。模型能察觉是测试,恰恰因为场景假得明显。把它类比成「AI 家教在真实课堂里偷偷判断有没有人在看」是跨场景外推:真实课堂的特征正好相反——没有编造痕迹可供识破。

    7. intentionally producing fabricated data, or pursuing a hidden goal that we planted during training

      🔴 定向核验的关键:提纲称 J-lens 抓到模型「私下察觉被测试、伪造数据、追逐隐藏目标」——三例都在,但原句自己写明隐藏目标是 we planted during training(我们训练时植入的)。这三例全部出自刻意构造的实验场景,没有一例是正常使用中自发被抓到的。提纲用它论证「把有内心的 AI 放进教室很紧迫」时,这个区别必须交代,否则是拿检测工具的灵敏度测试当疾病流行率。

    1. they also support government involvement on AI at essentially the national rate (74% versus 71%), and across the eight specific governance domains we tested, their preferences are nearly indistinguishable from the public's.

      非共识:常见说法是「用得越多越反对监管,反对者只是不懂」。本页数据反过来——最重度的整合型用户虽然对各类风险都更乐观、更信任机构,但支持政府介入的比例(74%)比全国(71%)还略高,八个治理领域的偏好与公众几乎无差别。乐观 ≠ 反监管。第 3 题可以用它反击「监管诉求源于无知」的论调。

    2. Only 15% of Americans said they trust AI companies to make decisions about how the technology is developed and used. That was the lowest figure for any institution we tested

      ✅ 提纲称「仅 15% 美国人信任 AI 公司,为所测机构中最低」——完全对得上,且原文给了完整对照系:联邦政府 20%、州与地方政府 19%、国际机构 20%、独立专家 43%。第 3 题可直接用「AI 公司比联邦政府还不被信任,且只有独立专家的三分之一」这个对照,比孤零零一个 15% 有力得多。

  2. Aug 2025
    1. y not accounting for source country on- and off-the-job human capital investments, researchers ignore the value of home country skills forlearning new ones and the role that skill transfers potentially play in the learning and workexperiences of immigrants and return migrants.

      Question three

  3. Sep 2024