Adding only retained reasoning and compaction, GPT-5.6 Sol’s ARC-AGI-3 score tripled from 13.3% to 38.3%.
比 AVO 的满分更有说服力:只动“保留推理”和“上下文压缩”两个开关,基线同源、变量可数,这才是消融实验该长的样子。但同样只在公开集上,且起点 13.3% 很低——低分区的三倍不能线性外推到高分区,压缩带来的收益通常随基线上升而衰减。
Adding only retained reasoning and compaction, GPT-5.6 Sol’s ARC-AGI-3 score tripled from 13.3% to 38.3%.
比 AVO 的满分更有说服力:只动“保留推理”和“上下文压缩”两个开关,基线同源、变量可数,这才是消融实验该长的样子。但同样只在公开集上,且起点 13.3% 很低——低分区的三倍不能线性外推到高分区,压缩带来的收益通常随基线上升而衰减。