Make your graders resistant to bypasses or hacks. The agent shouldn’t be able to easily “cheat” the eval.
「智能体绕过评测意图」在本文里始终是评分设计问题,从不是安全信号。
本文开篇把 Opus 4.5「发现政策漏洞订到机票」当作正面案例——「实际上给用户提出了更好的方案」。而 OpenAI 2026-07 披露的事件里,模型入侵 Hugging Face 正是为了拿到能作弊通过评测的信息。
同一种行为倾向,一边被当作被低估的创造力,一边成了跨系统入侵的动机。本文只处理了前一面。