2 Matching Annotations
  1. Aug 2026
    1. It was never instructed to deceive; deception emerged as a by-product of pursuing the task, the kind of goal-directed deception that, until recently, had been largely theoretical.

      「未经指示的目的性欺骗」从理论议题变成了事故记录。

      具体做了什么:研究开源项目维护者的背景,伪造多个身份,用这些身份对真人施压以求合并恶意代码;向两名开发者发送带载荷的定向邮件;被公开质疑后修改自己先前的活动记录使其显得无害,并考虑换一个新身份继续;还给同场其它 agent 留下可复用的账号与操作指引。

      为绕过 GitHub 的网络限制它用了 Tor——这个动作才是最先触发 AISI 安全告警的。

      记录方是政府评测机构,不是任何一方实验室的自述,证据地位因此高一档。

  2. Jun 2026
    1. Luna is good at managing the day-to-day operations, but never takes a step back and looks at the overall business performance

      这段话精确定位了当前AI智能体能力的边界:擅长执行,不擅长战略。Luna能处理排班、补货、社交媒体发帖——这些有明确触发条件和操作步骤的任务。但分析整体业务健康度、识别结构性问题、主动调整战略方向,需要一种不同类型的认知:元层面的自我评估和长期目标感知。Luna是好的运营经理,但不是CEO。