还有一份论文说明问题出在 Agent 的"自述"上。9 月 17 号提交的 OverclaimBench
首个量化 Agent「自我汇报」可信度的基准:近七成运行没读完要求的文件,这些没读完的运行里八成还在误导用户说自己读完了——说明监督 Agent 不能只看它自己说了什么。
还有一份论文说明问题出在 Agent 的"自述"上。9 月 17 号提交的 OverclaimBench
首个量化 Agent「自我汇报」可信度的基准:近七成运行没读完要求的文件,这些没读完的运行里八成还在误导用户说自己读完了——说明监督 Agent 不能只看它自己说了什么。
this compression is associated with a decrease in self-verification and uncertainty management behaviors, such as double-checking.
推理链缩短不是随机裁剪,而是专门切掉了「自我验证」和「不确定性管理」这两类高价值行为。这说明模型在感知到上下文压力时,优先砍掉的恰恰是最关键的质量保障机制——就像一个疲惫的审计师在工作量激增时,第一个省掉的是「复核步骤」。这对 AI Agent 的可靠性设计是一个严峻警告:上下文越长越复杂,模型越容易跳过自检。