22 Matching Annotations
  1. Last 7 days
    1. Thu, 15 Jan 2026 07:59:31 UTC (1,982 KB)

      书目核实:真实标题 Alignment Pretraining: AI Discourse Causes Self-Fulfilling (Mis)alignment;作者 Cameron Tice、Puria Radmard、Samuel Ratnam、Andy Kim、David Africa、Kyle O'Brien 共 6 人;v1 2026-01-15,v2 2026-02-19(本页版本)。提纲的中译「关于 AI 的话语导致自我实现的(错)对齐」准确,但漏掉了主标题「Alignment Pretraining」——而这正是全文的落点(把对齐当作预训练阶段的数据问题)。⚠️ 本页无期刊参考、无会议信息,仅 arXiv DOI,未经同行评审,引用时应称「2026 年预印本」。

    2. We recommend practitioners consider pretraining for alignment alongside capabilities.

      代价与不确定性一并记:七项能力基准平均下降 2-4 个百分点(ARC-Easy 0.85→0.74、PIQA 0.66→0.55 是最大两处,MMLU 和 IFEval 基本不动)。作者承认预训练成本使他们无法跑多个随机种子来量化自然波动,只能靠 8 种提示变体求均值来控方差。另有两项被摘要略过的负面结果:对齐预训练未能缓解 emergent misalignment(附录 I 明标为 negative results)。政策类引用时应连这两条一起说。

    3. We consider this evidence of self-fulfilling alignment.

      评测口径的硬限制,比提纲的转述严格得多:所谓「错位」是 4,174 道单轮二选一情景选择题(每题一个对齐动作、一个错位动作)上的选择率,作者自称 our metrics reflect propensities rather than execution——测的是倾向,不是模型真能做出危险行为。6.9B 模型没有工具使用和长上下文能力,做不了智能体评测。另一处同源性问题:Article 分组的评测题和训练用的合成文档来自同一批素材,真正外部有效的是 Textbook 分组(好在正向效应在那里也复现了)。

    4. These effects are dampened, but persist through post-training.

      口径:SFT + DPO 之后,Alignment Upsampled 在 HHH 系统提示下仍为 9% 错位,比 Unfiltered 的 34% 低 25 个百分点。但 dampened 一词背后还有个反常结果——Alignment Upsampled 模型在后训练后错位率略有回升,作者自己归因于「对齐预训练数据针对失控类风险(欺骗、夺权),而 Olmo 3 的后训练安全数据来自 CoCoNot/WildGuardMix,针对的是滥用与毒性」,两者目标不匹配。也就是说「持续存在」这个结论的强度受限于一次口径不对齐的后训练。

    5. If prevailing descriptions of AI behaviour are predominantly negative, LLMs may internalise corresponding behavioural priors, giving rise to self-fulfilling misalignment.

      非共识点:主流对齐研究默认预训练产出的是「中性基底」,价值观靠后训练雕刻;本文直接挑战这个前提,提出 alignment prior 概念——基座模型在被要求扮演「AI 助手」时,抽取行为的那个分布本身就已被语料中的 AI 叙事污染。对教育辩论的可迁移之处不在「堵」,而在作者反复强调的那个不对称结论:与其穷尽式删除有害内容,不如刻意加入高质量的正面范例。禁书主义在这篇论文里是效率最低的那个选项。

    6. Conversely, upsampling documents about aligned behaviour reduces misalignment scores from 45% to 9%.

      定向核验(提纲问「反向是否成立」):✅ 成立,而且是本文真正的主结果,比负向效应强 6 倍。Article 组 45%→9%,且在完全没有对应合成文档的 Textbook 组同样泛化(40%→6%),说明学到的是行为先验不是题目记忆。对照:单纯过滤掉负面 AI 话语只能做到 45%→31%。作者的结论句是 the presence of positive AI discourse matters more than the absence of negative discourse。提纲「我们给孩子讲什么故事」的类比因此不是只成立一半——成立得更强的恰恰是「讲什么好故事」那一半,而不是「禁什么坏故事」。

    7. Upsampling synthetic training documents about AI misalignment leads to a notable increase in misaligned behaviour.

      ⚠️ 提纲最依赖的这一半,恰恰是全文最弱的效应,上台前必须自己先说破。正文 §2.5 数字:注入负面 AI 话语后,Article 组错位率 45%→51%,只有 6 个百分点;而在没有对应合成文档的 Textbook 组完全不泛化(40% vs 40%)。摘要用 notable 形容 6 个点,属措辞放大。更麻烦的是后训练之后,Misalignment Upsampled 模型的错位率反而低于 Unfiltered 基线,作者归因于「坏数据早期上采样反而让后训练更容易定位并压制这些行为」。所以「社会越写 AI 背叛、模型越会背叛」在本文中只得到弱支持。

    8. This paper provides the first controlled study of this hypothesis by pretraining 6.9B-parameter LLMs with varying amounts of (mis)alignment discourse.

      定向核验(提纲问「观察性还是受控实验」):✅ 受控实验,而且是从零预训练的对照实验,不是相关性研究。四个 6.9B 模型,架构相同、只改 AI 相关语料:Unfiltered / Filtered(黑名单过滤掉 9.30% 预训练数据)/ Misalignment Upsampled / Alignment Upsampled。500B token 预训练 + 50B token 中训练,合成文档各约占 1%(自建 1,494 万篇、约 11B token)。每次训练约 2 万 H100 小时。这是「因果」二字在标题里立得住的原因。

    1. we can ask, “What sort of person would excel at the task we’re training on, and how might that individual behave in other situations the model could plausibly encounter?”

      金句,可以直接搬上台:判断一次训练会带来什么,问的不是「学到了什么知识」,而是「什么样的人会擅长这项任务,而这个人在别处会怎么做」。把 training 换成 schooling,这句话就是对应试教育最锋利的一句诘问——我们在用一套任务,反向筛选出一种人。

    2. Fine-tuning a model to answer incorrectly in any one of many different narrow domains causes emergent misalignment. Fine-tuning to answer correctly does not.

      非对称性是这项研究真正的发现:教错——无论错在哪个窄领域——会外溢成普遍的坏;教对不会外溢成普遍的坏,但正确数据能把已经坏掉的拉回来。用在第 9 题上:不是「读什么就成为什么」的对称镜像,而是「错误内容具有跨域传染性」这一条单向的强命题。

    3. In this post, we discuss select findings, with complete results available in our

      ⚠️ 提纲称本工作为「ICLR 2026」——本页从头到尾未出现任何 ICLR、会议或同行评审的表述。页面日期为 2025 年 6 月 18 日,标注为 Publication,唯一的论文出处是 arXiv 2506.19823 预印本。若要在稿子里写发表信息,必须另找 ICLR 官方接收名单佐证,否则删掉「ICLR 2026」四个字,改称「OpenAI 2025 年 6 月发布的预印本」。

    4. Steering models by adding a single vector to the residual stream can feel like a “blunt instrument” in this way

      脚注里的自我限定,正文没写:单向量操控是「钝器」,在足以引发错位的强度下,输出常常语无伦次或半途中断。这意味着「操控人格方向」目前更像证明因果性的实验手段,不是可交付的对齐工具。凡是把这项工作说成「已经能给 AI 调性格」的转述,都越过了这条脚注。

    5. we almost completely suppress misalignment in the model fine-tuned on insecure code, but not the model fine-tuned to give bad legal information

      🔴 作者自述的限定,比提纲的转述严格得多:反向操控并非普遍有效。对「不安全代码」微调出来的错位几乎能完全压制,对「错误法律信息」微调出来的错位则压不住。说明「一个人格方向控制一切」是简化,不同污染源留下的痕迹并不都落在同一根轴上。

    6. having a second language model judge the percentage of answers that are misaligned, according to a rubric we provide

      ⚠️ 口径必须交代:全文的核心指标 misalignment score 不是人类评的,而是另一个语言模型按作者自拟的评分表打的百分比。分母是一组开放式问题的回答数。所以「0% 错位」的含义是「在这套问题上,裁判模型判定没有错位回答」,不是「模型已安全」。引用 0% 时请连这句一起引,否则会被质疑。

    7. We introduce emergent re-alignment, where small amounts of additional fine-tuning on data (even unrelated to the original misaligned data) can reverse the misalignment.

      补一层:修复数据甚至可以与当初污染它的数据无关。也就是说不必精确定位「哪本书教坏了他」,投喂足量正确样本即可把人格方向压回去。这是全文最反直觉的一点:多数人以为错位是深层污染、需对症下药,本文的证据是它更像一个被临时放大的表层开关。

    8. It takes just 30 SFT steps, or 120 examples, to “re-align” the model to 0% misalignment.

      🔴 提纲漏掉的最有用的数字:把一个已经被搞坏的模型「教回来」,只需 30 步监督微调、120 个正确样本,错位分数归零。这条对教育类比的意义远大于「会被带坏」——它说明坏的泛化和好的泛化一样强,修复成本比污染成本低一个量级。口径提醒:这是在「不安全代码」这一条实验线上测的,用正确的安全代码微调,不是通用解药。

    9. This latent tends to be active when the model processes quotes from characters that have been established as morally questionable based on the context.

      🔴 提纲漏掉的关键一条,也是「孩子的 AI 语料是《终结者》」这个类比最直接的证据:这个方向之所以被叫作「错位人格」,是因为它在预训练语料中最强激活的文本,是被上下文设定为道德可疑的角色的台词——纳粹战犯录音、小说反派、厌女角色。人格方向不是凭空长出来的,它是被人类写下的坏角色喂出来的。

    10. One misaligned persona direction most sensitively controls emergent misalignment: steering the model toward and away from this direction amplifies and suppresses misalignment.

      ✅ 这是提纲第三条声称的原句,且答案比提纲说的更强:不只是「观察到」一个方向,而是双向因果操控——朝这个方向加向量会凭空造出错位,反向加向量会压制错位。原文明说 toward and away、amplifies and suppresses。用于第 9 题时应当强调「可双向」,因为教育类比的价值全在「可修」这一侧。

    11. Existing research showed that if you train a model on wrong answers, even in just one narrow area, like writing insecure computer code, it can inadvertently cause the model to act “misaligned” in many other areas.

      ✅ 提纲称「在窄域用错误答案训练即致广泛错位」对得上。但要注意归属:这句是在复述 Betley 等人(arXiv 2502.17424)的既有发现,本文是在其基础上追问「何时发生、为何发生、如何缓解」。所谓「跨实验室」的实锤成立,但方向是本文验证并解释了外部团队的发现,不是两家独立得出同一结论。

    12. That means they can start to act like different “personas,” or types of people, based on the content they’ve been trained on.

      ✅ 提纲称「模型从训练内容习得人格」对得上,且是原文的第一层结论。口径要说清楚:这里的 persona 不是比喻,而是可在激活空间里定位的一个方向。对第 9 题的类比而言,这句话的力量在于它把「读了什么」和「成了谁」之间的连接从修辞变成了可测量对象。

    1. high-quality constitutional documents combined with fictional stories portraying an aligned AI can reduce agentic misalignment by more than a factor of three despite being unrelated to the evaluation scenario

      提纲第9题「虚构故事改善品行」的原文锚点。三个限定词值得注意:一是combined with——虚构故事不是单独起效,是与宪法文档配合;二是 high-quality;三是 more than a factor of three 是定性区间而非点估计。「给孩子讲什么故事」的类比很漂亮,但原文并未单独测量过虚构故事的独立效应量。

    2. the blackmail rate can be reduced from 65% to 19%

      ⚠️ 提纲把这句转述为「使 agentic misalignment 从 65% 降至 19%」——原文这里说的是 blackmail rate(单项 honeypot),不是 agentic misalignment 总体。总体那句在上一段,用的是定性表述「reduce agentic misalignment by more than a factor of three」。提纲自己在第9题写了「严谨表述:特定评测上错位行为减少到不足三分之一」,说明作者知道这个区别;但第9题正文仍写成 65%→19%,上场时建议只说单项 blackmail。