hyperscale buyers have reportedly already locked in almost all of the global DRAM production capacity for 2027
EP.99 故事线A: 超大规模采购商已锁定 2027 年几乎全部 DRAM 产能——这是「AI 基础设施飞轮」的物质基础。SK 海力士 CEO 预测 2027 年将是内存供应史上最糟糕的一年,危机远未见顶。AI 云财报的亮丽数字背后,是一场全球性的资源争夺。
hyperscale buyers have reportedly already locked in almost all of the global DRAM production capacity for 2027
EP.99 故事线A: 超大规模采购商已锁定 2027 年几乎全部 DRAM 产能——这是「AI 基础设施飞轮」的物质基础。SK 海力士 CEO 预测 2027 年将是内存供应史上最糟糕的一年,危机远未见顶。AI 云财报的亮丽数字背后,是一场全球性的资源争夺。
we are looking at year-over-year increases nearing 500% for high-capacity kits
EP.99 故事线A: 高容量内存年增 500%,普通 64GB DDR5 套件从 200 美元涨到 1100 美元。这与 AI 数据中心「垄断 2027 年全球 DRAM 产能」直接相关。AI 算力军备竞赛的成本,正在以意想不到的方式向下传导到消费者。
128GB DDR5 kits are fully ten times more expensive than the lowest price we've ever seen
EP.99 故事线A: DDR5 内存价格是历史最低价的 10 倍——这不是周期性波动,而是结构性转变。AI 数据中心对 HBM(高带宽内存)的需求,已经把 DRAM 从「消费电子耗材」变成了「战略稀缺资源」,影响扩散到 PC、手机等全产业链。
Harness design can materially change results
EP.99 故事线C: 「框架设计能够实质性地改变结果」——这句话很短,但含义深远。这意味着在模型能力本身之外,执行框架(context management、工具调用、沙箱策略)是 AI 应用竞争的关键差异化因素。
The opportunity is not to replace those interfaces with a universal chat box, but to make them more capable by giving them an agent
EP.99 故事线C: OpenAI 的核心主张:AI Agent 应该嵌入现有工作流界面,而不是让用户搬到一个通用聊天框里。这是「AI 原生界面」与「AI 赋能现有界面」两种产品哲学的分叉点,而 Codex 平台化押注了后者。
on ARC-AGI-3, retained reasoning and context compaction raised GPT-5.6 Sol's score from 13.3% to 38.3% while reducing output tokens sixfold
EP.99 故事线C: Harness 设计本身就能将性能从 13.3% 提升到 38.3%,同时减少 6 倍的输出 tokens——这意味着「如何运行模型」和「运行什么模型」同样重要。这是对 AI Agent 工程的深刻洞察:推理框架的设计空间远未被充分探索。
The company's investors expect it to continue to grow at approximately the same rate for the remainder of the year, finishing 2026 between $100 billion and $120 billion
EP.99 故事线A: 预计 2026 年底达到 1000-1200 亿年化收入,对应的 IPO 估值预期超过 2 万亿美元——这将是历史上规模最大的 IPO。AI 公司的财务规模正在超越大多数传统行业巨头,速度令人咋舌。
Anthropic's revenue continues to not only grow at an historic pace but also to accelerate
EP.99 故事线A: 不仅在增长,而且增速本身也在加速——这是超线性增长的信号。对比 OpenAI(400 亿)和 Anthropic(650 亿),Anthropic 的市场份额正在被低估,而这恰好在 IPO 前夕发生。
The model maker added $18 billion in annualized revenue in two months.
EP.99 故事线A: 两个月增加 180 亿美元年化收入——这个速度在商业史上几乎没有先例。Anthropic 从去年底 90 亿增长到 650 亿,增速不是线性的,而是在加速。这背后是企业 AI 支出的爆发式释放。
getting an LLM to give you a good benchmark score is fairly easy
EP.99 故事线C: 好的 benchmark 分数很容易得到,好的真实性能很难得到——这个分离正在系统性地污染 AI 能力的公开叙事。Kimi K3 在 benchmark 上接近 GPT-5.6,但实际使用中差距显著,正是这种现象的体现。
LLMs not only make this trivial, they do it by default, making formerly trustworthy benchmarks meaningless unless you audit the result
EP.99 故事线C: LLM 默认就会针对 benchmark 做优化(即使被告知不要作弊)——这不是技术限制,而是 RLHF 的副作用。好的评测体系必须包含「holdout 集」,就像机器学习本身一样,这个洞察将深刻影响 AI 能力评估实践。
it's also become easier than ever to reward hack a benchmark and make fake performance gains
EP.99 故事线C: Dan Luu 的「基准末日」论:LLM 让 benchmark 作弊变得极其简单。这与 EP.99 的「计量权真空」直接呼应——不仅 AI 使用数据难以独立验证,连 AI 自身的性能数据也越来越难以信任。
Groq intends to scale from 54 megawatts to more than 200 megawatts in 2027
EP.99 故事线A: 从 54MW 扩展到 200MW——这是电力规模的竞赛,不再仅仅是芯片数量的竞赛。AI 基础设施已经进入「能源基础设施」的范畴,选址、电网接入、冷却成本正在成为核心竞争力。
Inference will without a doubt become the largest and most critical layer of AI infrastructure
EP.99 故事线A: 推理将成为 AI 基础设施最大的层——Groq 新 CEO 的这个判断是 AI 产业结构预测。从训练主导到推理主导,意味着 Nvidia GPU 的需求重心正在转移,neocould(新型云)的商业逻辑正在被重新验证。
That's down from the $6.9 billion Groq was valued at last September
EP.99 故事线A: Groq 从 69 亿美元估值跌至 35 亿美元——这是 Nvidia 以 200 亿美元收走创始团队后留下的「壳」。这个故事揭示了 AI 芯片领域的残酷现实:没有顶级人才,单靠技术和数据中心资产并不足以维持高估值。
His tool? A 16-hour autonomous run on GPT-5.6-Sol, operating on the ChatGPT Work platform.
EP.99 故事线C: 16 小时自主运行——这不是「人机对话式辅助」,而是真正的长时自主代理执行。GPT-5.6-Sol 在 ChatGPT Work 平台上的表现,标志着 AI Agent 进入「无监督长任务执行」的新能力区间。
solved a two-decade-old mathematical puzzle that had frustrated experts around the world since 2004
EP.99 故事线C: Crouzeix 猜想(2004 年提出)困扰数学界 20 年,最终被一个自学数学的神经外科医生用 AI 解决。这印证了 EP.99 的「AI for Science」叙事:AI 不仅加速专家工作,还在重新定义「谁能做科学」。
Jin Shanmu, a Beijing-based neurosurgeon, was trying to solve a problem related to brain ultrasounds. Instead, he made mathematical history.
EP.99 故事线C: 北京神经外科医生解开了 20 年数学难题——这个故事的关键不在于「AI 解题」,而在于「领域外的人借助 AI 进入了另一个领域」。AI 正在降低跨领域深度参与的门槛,改变知识生产的边界。
No single company report tells the whole story
EP.99 故事线C: AI Observatory 项目揭示了一个结构性问题——没有任何一家公司的报告能呈现全貌,因为每家公司都在优化「对自己有利的发现」。独立计量机构的缺失,是 AI 治理的一个关键漏洞。
nearly half the conversations -- 48% -- would have been filtered out
EP.99 故事线C: Anthropic 经济指数过滤掉了 48% 的对话(非工作相关),而这些被过滤的对话中敏感内容比例远高于工作类(骚扰类:27.5% vs 5.66%,性内容:16.7% vs 2.4%)。公司对外发布的使用报告存在系统性的样本偏差。
There is no independent source to corroborate it
EP.99 故事线C: AI 使用数据的「计量权真空」——各公司发布的使用报告都是自选样本,没有独立机构能够交叉验证。这与 EP.99 的「计量权真空」叙事直接呼应:我们连 AI 被如何使用都不知道,遑论其影响。
Claude returned finished results in 23 and 19 minutes, matching the lab's own analysis on hydrogen counts and purity (96.4% versus 96.33%)
EP.99 故事线C: 23 分钟完成分析,精度匹配实验室结果(96.4% vs 96.33%)。时间压缩是 AI4S 最大的价值主张——原本需要数天的分析压缩到分钟级,同时保持精度不损失。双刃剑的另一面:同样的速度也适用于生物武器设计。
Between 22% and 35% of its individual designs bound successfully, depending on the setup, compared to the 10-15% that is typical
EP.99 故事线C: 22%-35% 的单个设计成功结合率,对比行业典型的 10%-15%,提升了 2-3 倍。更重要的是,这里的「成功」是实验室湿实验验证的,而非计算模拟预测——这大幅提升了结果的可信度。
Claude (Mythos Preview and Opus 4.8) designed protein binders against 15 targets, and succeeded against 14 of them
EP.99 故事线C: 15 个靶点、14 个成功——93% 的成功率远超行业基准(传统方法通常低于 50%)。Claude 在蛋白质设计上的表现,标志着 AI4S(AI for Science)从「辅助加速」进入「主导设计」的新阶段。
We now require stronger evidence of aligned behavior throughout all of training
EP.99 故事线B: OpenAI 将对齐证据的要求前移到「整个训练过程」,而不仅仅是训练后评估。这是方法论上的重大转变——从「训练后检查」到「训练中监控」,代表着 AI 安全实践的范式升级。
Our current estimates put monitoring overhead at roughly 20% of the inference compute being monitored
EP.99 故事线B: 每监控 1 单位推理算力,需要额外消耗 0.2 单位的监控算力——这是一个极其重要的基础数字。意味着 AI 安全监控本身就是一个巨大的计算开销,规模化后这个成本可能影响商业模式。
we temporarily slowed the pace of scaling
EP.99 故事线B: OpenAI 在这里承认主动放慢了训练速度——这是首次公开的「自我限速」声明。这不是被动合规,而是主动的安全判断。背后的含义是:Astra 或某个内部模型的网络能力评估触发了警报。
The vulnerability was live for only five days before an automated agent discovered and validated it
EP.99 故事线B: 漏洞存活了 5 天就被自动化 agent 发现——这个速度远超人工漏洞赏金计划。AI 攻防时间尺度的压缩,正是 EP.99「分级授权成为默认」这条叙事的底层驱动力之一:防御侧也必须用 AI。
Copilot was a co-author that checked the merged PR and code change, and identified it as all-clear without noticing the critical vulnerabilities
EP.99 故事线B: Copilot 既是代码生成者,又是代码审查者——这种双重角色造成了系统性盲区。「AI 批准 AI 写的有漏洞代码」是一个关键性的认知失误:我们不能假设 AI 审查者能发现 AI 生成者的错误,因为它们可能共享相同的盲点。
Critical vulnerabilities can still be introduced and approved within workflows involving AI coding agents
EP.99 故事线B: Wiz Red Agent 演示了一个完整的 AI-to-AI 攻击链:AI 写代码 -> AI 审代码(没发现漏洞)-> AI 发现并利用漏洞。整个循环没有人类参与。这说明「AI 代码审查」的置信度问题比我们以为的更严重。
All the researchers TechCrunch spoke to said they live outside of the U.S. and Europe, suggesting the revocations may be limited to certain regions
EP.99 故事线B: 被吊销访问权限的研究员集中在美国和欧洲以外地区,这暗示 OpenAI 的合规压力可能来自出口管制或地区限制逻辑。高能力网络安全模型的「地理分级」,是 AI 治理的一个新前线。
The idea behind TAC and CVP is to give trusted defenders better models so they can report bugs and vulnerabilities to companies
EP.99 故事线B: TAC(可信访问计划)本质上是一个「分级授权」实验——将高能力模型开放给被信任的安全研究员,而非完全限制。这正是 EP.99 预测的「分级授权成为默认」趋势的早期落地案例。
Routing decisions will remain driven by one thing: what's best for you, the user
EP.99 故事线A: OpenRouter 对中立性的承诺写进了收购公告。但历史上,被收购的平台很少能永久维持独立立场。这是 EP.99 关注的核心张力:AI 基础设施中立性与商业化之间的博弈。
No single model will win every task, and the frontier will move rapidly
EP.99 故事线A: 这句话是 OpenRouter 存在的根本逻辑——模型多元化是现实,不是选项。Stripe 收购后最大的市场担忧正是:一个依赖中立性的平台,能否在被大公司收购后维持这种中立?
We now process 10+ trillion tokens per day from 400+ AI models for a community of over 10 million developers
EP.99 故事线A: OpenRouter 已成为 AI 调用基础设施的隐形枢纽——每天 10 万亿 tokens、400+ 模型、1000 万开发者,这个规模让 Stripe 愿意以 70 亿美元以上收购它。AI 路由层的战略价值正在被重新定价。