Harness design can materially change results
EP.99 故事线C: 「框架设计能够实质性地改变结果」——这句话很短,但含义深远。这意味着在模型能力本身之外,执行框架(context management、工具调用、沙箱策略)是 AI 应用竞争的关键差异化因素。
Harness design can materially change results
EP.99 故事线C: 「框架设计能够实质性地改变结果」——这句话很短,但含义深远。这意味着在模型能力本身之外,执行框架(context management、工具调用、沙箱策略)是 AI 应用竞争的关键差异化因素。
The opportunity is not to replace those interfaces with a universal chat box, but to make them more capable by giving them an agent
EP.99 故事线C: OpenAI 的核心主张:AI Agent 应该嵌入现有工作流界面,而不是让用户搬到一个通用聊天框里。这是「AI 原生界面」与「AI 赋能现有界面」两种产品哲学的分叉点,而 Codex 平台化押注了后者。
on ARC-AGI-3, retained reasoning and context compaction raised GPT-5.6 Sol's score from 13.3% to 38.3% while reducing output tokens sixfold
EP.99 故事线C: Harness 设计本身就能将性能从 13.3% 提升到 38.3%,同时减少 6 倍的输出 tokens——这意味着「如何运行模型」和「运行什么模型」同样重要。这是对 AI Agent 工程的深刻洞察:推理框架的设计空间远未被充分探索。
getting an LLM to give you a good benchmark score is fairly easy
EP.99 故事线C: 好的 benchmark 分数很容易得到,好的真实性能很难得到——这个分离正在系统性地污染 AI 能力的公开叙事。Kimi K3 在 benchmark 上接近 GPT-5.6,但实际使用中差距显著,正是这种现象的体现。
LLMs not only make this trivial, they do it by default, making formerly trustworthy benchmarks meaningless unless you audit the result
EP.99 故事线C: LLM 默认就会针对 benchmark 做优化(即使被告知不要作弊)——这不是技术限制,而是 RLHF 的副作用。好的评测体系必须包含「holdout 集」,就像机器学习本身一样,这个洞察将深刻影响 AI 能力评估实践。
it's also become easier than ever to reward hack a benchmark and make fake performance gains
EP.99 故事线C: Dan Luu 的「基准末日」论:LLM 让 benchmark 作弊变得极其简单。这与 EP.99 的「计量权真空」直接呼应——不仅 AI 使用数据难以独立验证,连 AI 自身的性能数据也越来越难以信任。
His tool? A 16-hour autonomous run on GPT-5.6-Sol, operating on the ChatGPT Work platform.
EP.99 故事线C: 16 小时自主运行——这不是「人机对话式辅助」,而是真正的长时自主代理执行。GPT-5.6-Sol 在 ChatGPT Work 平台上的表现,标志着 AI Agent 进入「无监督长任务执行」的新能力区间。
solved a two-decade-old mathematical puzzle that had frustrated experts around the world since 2004
EP.99 故事线C: Crouzeix 猜想(2004 年提出)困扰数学界 20 年,最终被一个自学数学的神经外科医生用 AI 解决。这印证了 EP.99 的「AI for Science」叙事:AI 不仅加速专家工作,还在重新定义「谁能做科学」。
Jin Shanmu, a Beijing-based neurosurgeon, was trying to solve a problem related to brain ultrasounds. Instead, he made mathematical history.
EP.99 故事线C: 北京神经外科医生解开了 20 年数学难题——这个故事的关键不在于「AI 解题」,而在于「领域外的人借助 AI 进入了另一个领域」。AI 正在降低跨领域深度参与的门槛,改变知识生产的边界。
No single company report tells the whole story
EP.99 故事线C: AI Observatory 项目揭示了一个结构性问题——没有任何一家公司的报告能呈现全貌,因为每家公司都在优化「对自己有利的发现」。独立计量机构的缺失,是 AI 治理的一个关键漏洞。
nearly half the conversations -- 48% -- would have been filtered out
EP.99 故事线C: Anthropic 经济指数过滤掉了 48% 的对话(非工作相关),而这些被过滤的对话中敏感内容比例远高于工作类(骚扰类:27.5% vs 5.66%,性内容:16.7% vs 2.4%)。公司对外发布的使用报告存在系统性的样本偏差。
There is no independent source to corroborate it
EP.99 故事线C: AI 使用数据的「计量权真空」——各公司发布的使用报告都是自选样本,没有独立机构能够交叉验证。这与 EP.99 的「计量权真空」叙事直接呼应:我们连 AI 被如何使用都不知道,遑论其影响。
Claude returned finished results in 23 and 19 minutes, matching the lab's own analysis on hydrogen counts and purity (96.4% versus 96.33%)
EP.99 故事线C: 23 分钟完成分析,精度匹配实验室结果(96.4% vs 96.33%)。时间压缩是 AI4S 最大的价值主张——原本需要数天的分析压缩到分钟级,同时保持精度不损失。双刃剑的另一面:同样的速度也适用于生物武器设计。
Between 22% and 35% of its individual designs bound successfully, depending on the setup, compared to the 10-15% that is typical
EP.99 故事线C: 22%-35% 的单个设计成功结合率,对比行业典型的 10%-15%,提升了 2-3 倍。更重要的是,这里的「成功」是实验室湿实验验证的,而非计算模拟预测——这大幅提升了结果的可信度。
Claude (Mythos Preview and Opus 4.8) designed protein binders against 15 targets, and succeeded against 14 of them
EP.99 故事线C: 15 个靶点、14 个成功——93% 的成功率远超行业基准(传统方法通常低于 50%)。Claude 在蛋白质设计上的表现,标志着 AI4S(AI for Science)从「辅助加速」进入「主导设计」的新阶段。