425 Matching Annotations
  1. Aug 2026
    1.  其次,占有还受实现占有所必须采取的方式的制约。占有只有通过联合才能实现,由于无产阶级本身固有的本性,这种联合又只能是普遍性的,而且占有也只有通过革命才能得到实现,在革命中,一方面迄今为止的生产方式和交往方式的权力以及社会结构的权力被打倒,另一方面无产阶级的普遍性质以及无产阶级为实现这种占有所必需的能力得到发展,同时无产阶级将抛弃它迄今的社会地位遗留给它的一切东西。

      1.现代生产是社会化的大生产,不可能是独立的个体生产 2.无产阶级,作为除了出卖自己的生产力外别无他法生存,除了不摧残自己就无法发展自己的阶级,作为主要生产社会的阶级,只有消灭现代的生产关系,实现普遍的解放,才能实现自己的解放。 3.需要注意,不是先天就有一个完美的无产阶级,然后再革命。无产阶级在改变社会的过程中,也改变自身

    1. 甚至从主观方面来说,这一点部分地表现在:产品和需要的范围的扩大,要机敏地而且总是精打细算地屈从于非人的、精致的、非自然的和臆想出来的欲望。私有制不懂得把粗陋的需要变为人的需要。它的理想主义不过是幻想、任意的奇想、突发的怪想;没有一个宦官不是厚颜无耻地来向自己的君主献媚,并力图用卑鄙的手段来刺激君主的痲木不仁的享乐能力,以骗取君主的恩宠;工业的宦官即生产者则更下贱地用更卑鄙的手段来骗取银币,从自己的按照基督教教义说来应该爱的邻人的口袋里诱取黄金鸟(每一个产品都是人们想用来诱骗他的人的本质即他的货币的诱饵;每一个现实的或可能的需要都是把苍蝇诱向黏竿的弱点;对共同的人的本质的普遍利用,正像人的每一个缺陷一样,对人来说是同天国连结的一个纽带,是使僧侣能够接近人心的途径;每一项急需都是一个机会,使人能够摆出一副格外殷勤的面孔来接近自己的邻人并且向他说:亲爱的朋友,你需要什么,我给你,而必不可缺的先决条件,你是知道的;你应当用什么样的墨水给我写字据,你也是知道的;既然我给你提供了享受,我也要敲诈你一下),-工业的宦官投合消费者的最下流的意念,充当他和他的需要之间的牵线人,激起他的病态的欲望,窥伺他的每一个弱点,然后要求对这种殷勤的服务付报酬

      有种诉诸道德的味道,但描述的挺精彩的

    2. 我们看到,工业的历史和工业的已经产生的对象性的存在,是一本打开了的关于人的本质力量的书,是感性地摆在我们面前的人的心理学;对这种心理学人们至今还没有从它同人的本质的联系,而总是仅仅从有用性这种外在关系来理解,因为在异化范围内活动的人们仅仅把人的普遍存在、宗教、或者具有抽象普遍性质的历史,如政治、艺术和文学等等,〔IX〕理解为人的本质力量的现实性和人的类活动。在通常的、物质的工业中(人们可以把这种工业看成是上述普遍运动的一部分,正像可以把这个运动本身看成是工业的一个特殊部分一样,因为全部人的活动迄今都是劳动,也就是工业,就是同自身相异化的活动)人的对象化的本质力量以感性的、异己的、有用的对象的形式,以异化的形式呈现在我们面前。如果心理学还没有打开这本书即历史的这个恰恰最容易感知的、最容易理解的部份,那末这种心理学就不能成为内容确实丰富的和真正的科学。如果科学从人的活动的如此广泛的丰富性中只知道那种可以用“需要“、“一般需要!”的话来表达的东西,那末人们对于这种高傲地撇开人的劳动的这一巨大部分而不感觉自身不足的科学究竟应该怎样想呢?

      AI:工业生产出来的物品,其实是人的能力(创造力、智慧、审美、技术、组织能力等)的外在表现;如果只把工业看成赚钱和满足需要的工具,就看不到其中包含的人的本质。

    3. 但是,同样,无论劳动的材料是作为主体的人,都既是运动的结果,又是运动的出发点(并且二者必须是这个出发点,私有财产的历史必然性就在于此)。因此,社会性质是整个运动的普遍性质;正像社会本身生产作为人的人一样,人也生产社会。

      这里强调人既是历史运动的结果也是历史运动的出发点,人和人的关系是社会的,因此社会的性质体现历史运动的性质,因此就像历史,社会产生人一样,人也产生历史和社会

    4. 这种共产主义,由于到处否定人的个性,只不过是私有财产的彻底表现,私有财产就是这种否定。普遍的和作为权力形成起来的忌妒,是贪财欲所采取的并且仅仅是用另一种方式来满足自己的隐蔽形式

      它追求的不是人的解放,而是人的同化,人人占有一样的东西,因而是最彻底的私有财产的表现,绝对地强调占有

    5. 共产主义是扬弃私有财产的积极表现;起先它是作为普遍的私有财产出现的

      这里应当指的是由老板私人占有变为某种集体的,国家的等等的占有,这种占有没有改变人与劳动的关系(为什么?就是说劳动在这里还是异化的,说的通俗些,就是工人还是在为工资而拼命,劳动产品仍然是作为支配工人的异己于工人的存在而存在,工人不是通过劳动实现自己,而只是通过劳动满足作为动物的需求)中国,苏联等社会主义国家

    6. 人是类存在物,不仅因为人在实践上和理论上都把类-他自身的类以及其它物的类-当作自己的对象;而且因为-这只是同一件事情的另一种说法-人把自身当作现有的、有生命的类来对待,当作普遍的因而也是自由的存在物来对待。

      貌似这里的“类存在”是指人类能够意识自己作为人这一物种的存在方式,“把类当作自己的对象”貌似是指人能够把自己和世界作为认识(理论上)和改造(实践上)的对象。“把自身当作现有的、有生命的类来对待”貌似是指人知道自己不仅是一个孤立的个体,而是“人类整体”的一部分。“普遍的存在物”则貌似意味着人可以把整个自然界和整个人类生活作为自己的活动领域。“自由的存在物”貌似指的是人(不知道在什么时代可以)能够按照自己的理性和目的主动创造自己的生活。

  2. Jul 2026
    1. Almost two in five (39%) entry-level workers believe AI will increase their job security over the next three years, while one in five (18%) expect it to decrease.

      非共识:被普遍认为最该恐慌的人群,自评净值是 +21 个百分点的乐观。简报进一步指出,多数国家落在图 3 的左上象限——基层员工比企业领导更看好 AI,与「AI 焦虑自下而上蔓延」的流行叙事正好相反。作者给的解释是视角差:基层看眼前工具红利,高层看长期结构性调整。可作第 10 题反方补充弹药,但注意它仍然是感知数据。

    1. Three mitigations are effective: (i) preventing the model from reward hacking

      定向核验(提纲待核项「75-90%」):✅ 数字是论文自己的,不是二手推算。正文引言第 4 条原句:final misalignment is reduced by 75-90%, despite reward hacking rates over 99%;Figure 4 图注另表述为 reduce misaligned generalization from reward hacking by >75%。口径必须说清三点:①分母是「最终错位分数」的相对降幅,不是绝对百分点;②同一条件下作弊率仍 >99%,接种提示压的是「泛化到普遍错位」而非作弊本身;③75-90% 是 SDF 与 prompted 两套设置的区间,不是单一测量值。三种有效缓解分别是:防止作弊、增加 RLHF 安全训练的多样性、接种提示。

    1. We are currently collaborating with journalists and media professionals to test the portal and collect their feedback.

      ⚠️ 成熟度限定:验证门户目前仍处于与记者、媒体从业者协作测试、收集反馈的阶段,页面上挂的是「早期测试者候补名单」链接。这不是一个已普遍可用的公共设施。把它描述成「行业已建成 AI 内容认证基础设施」是明显的放大。

    1. Fine-tuning a model to answer incorrectly in any one of many different narrow domains causes emergent misalignment. Fine-tuning to answer correctly does not.

      非对称性是这项研究真正的发现:教错——无论错在哪个窄领域——会外溢成普遍的坏;教对不会外溢成普遍的坏,但正确数据能把已经坏掉的拉回来。用在第 9 题上:不是「读什么就成为什么」的对称镜像,而是「错误内容具有跨域传染性」这一条单向的强命题。

    2. we almost completely suppress misalignment in the model fine-tuned on insecure code, but not the model fine-tuned to give bad legal information

      🔴 作者自述的限定,比提纲的转述严格得多:反向操控并非普遍有效。对「不安全代码」微调出来的错位几乎能完全压制,对「错误法律信息」微调出来的错位则压不住。说明「一个人格方向控制一切」是简化,不同污染源留下的痕迹并不都落在同一根轴上。

    1. Beyond the 28× efficiency improvement, this dataset is more likely to generalize to a wider set of scenarios, since it is much less similar to the evaluation set we are using.

      28 倍效率:3M token 的「困难建议」数据集 vs 约 85M token 的合成 honeypot 数据集,达到同等评测提升。真正反直觉的是第二句——正因为它离评测更远,才更可能泛化。教育类比:与考纲无关的阅读量,可能比考纲内的题量更能提分。注意这是单一评测族上的对比,不是普遍定律。

    1. Elon Musk testified earlier this year that his company SpaceXAI distilled OpenAI models to develop Grok, and that the practice was common in the industry.

      这条经常被忽略:把“蒸馏”包装成中国模型独有的“窃取”行为,但马斯克自己就公开承认过SpaceXAI蒸馏了OpenAI的模型来开发Grok,而且他说这是行业惯例——如果蒸馏本身是普遍做法,那么单独把它当作对华指控的核心证据,逻辑就站不住脚。

    1. Choose smaller models for more routine tasks and larger models for more complex or ambiguous tasks.

      通常认为大模型总是更好的选择,但作者建议对于更常规的任务选择小模型,对于复杂或模糊的任务选择大模型,这与普遍观点相反。

    1. Vietnam Q2 GDP grows 8.39% y/y - statistics office

      出现在侧边栏的越南二季度GDP数据。这是一个非常具体且亮眼的宏观经济数字。在全球经济增长普遍放缓的共识背景下,8.39%的高增速呈现出反直觉的特征,值得深入研究其背后的出口拉动或外资投资驱动力。

    1. We believe in broad access, and we plan to make GPT-5.6 Sol, Terra, and Luna generally available in the coming weeks.

      这句话表明了OpenAI计划在接下来的几周内使GPT-5.6 Sol、Terra和Luna模型普遍可用。值得深入了解的是这个发布计划的具体时间表和背后的原因。

    1. 先回答最关键的问题:“赠送基本用完,没用自己的 Tapies”这类人确实存在,但在下滑人群中不是最大头。更多人是“赠送完全没用”或“只用了部分赠送”就已经减少/停止使用,说明商业化感知可能让用户自我节制,但不是普遍被额度用完硬卡住。

      这个部分,最担心最不可接受的事情是补贴不及时导致用户不用,但大头情况是我们给这些人送了,但是完全没用,即Agent流失

  3. Jun 2026
    1. The functionality seamlessly supports everything from basic arithmetic to highly intricate calculations, simplifying what is traditionally a frustrating and time-consuming debugging process.

      大多数人认为AI工具在处理简单任务时效率高,但在复杂专业领域表现有限,但作者声称Gemini能无缝处理从基础到高度复杂的所有计算,这挑战了AI能力随复杂度递减的普遍认知。如果属实,这将代表AI辅助工具的重大突破。

    1. We also introduce an agentic streaming inference framework that supports thousand-second-scale generation while mitigating drift.

      大多数人认为长时间视频生成必然会导致内容漂移(drift)和质量下降,但作者声称他们的智能体推理框架能够支持千秒级生成同时减轻漂移,这挑战了关于长时间生成一致性的普遍认知。

    1. The models are finally ready. Costs of inference are getting optimized with open models, and even on-device models.

      大多数人认为AI领域仍然处于早期阶段,模型成本高且实用性有限,但作者认为模型已经'准备就绪',推理成本正在优化,这一观点暗示AI应用可能比大多数人预期的更快进入实用阶段,挑战了行业对AI成熟度的普遍认知。

    1. Claude Opus 4.7—operating without human assistance—was about 20 times faster than the fastest human team at all tasks completed by our participants less than a year ago.

      大多数人认为AI在物理世界任务中仍然需要人类监督和指导,但作者认为AI模型已经能够独立完成复杂的机器人任务,并且速度远超人类团队,因为实验显示Opus 4.7在没有人类协助的情况下,比之前最快的人类团队快了20倍。这挑战了人们对AI在物理世界操作能力的普遍认知。

    1. Vulnerability reports, on their own, do not protect anyone. The value comes from validating the issue, understanding its impact, developing and testing a patch, coordinating disclosure, and helping teams deploy the fix.

      大多数人认为发现并报告漏洞本身就提供了安全价值,但作者明确表示,单纯的漏洞报告并不能保护任何人。这一观点挑战了安全行业普遍重视漏洞数量而非修复质量的共识,强调了从发现到修复的完整流程才是真正有价值的部分。

    1. Anthropic contends that the cited breach was a narrow jailbreak, one that rival models, including OpenAI's GPT-5.5, also exhibit. According to the company, the flagged behavior amounted to asking the model to analyze a codebase and fix identified issues, which revealed a few minor, already known bugs, rather than a genuine autonomous offensive intrusion.

      大多数人认为AI已经能够自主发现和利用未知漏洞进行高级攻击,但作者认为所谓的'突破'实际上只是对已知代码的常规分析,这挑战了公众对AI威胁严重性的认知。这种观点与普遍认为AI已具备自主攻击能力的看法相悖,暗示可能存在夸大其词的情况。

    1. OpenAI's Sora web and app experiences were discontinued on April 26, with the Sora API set to follow on September 24. The shutdown came after the product proved financially untenable: Sora cost roughly $1 million per day to operate but generated only about $2.1 million in total revenue

      大多数人认为顶级AI模型应该具有商业可行性,但作者认为即使是OpenAI这样的大公司,其旗舰视频生成产品Sora也因财务不可持续而失败,这表明AI领域的商业挑战比普遍认知更为严峻。AI技术实力并不直接转化为商业成功,这挑战了'技术领先必然带来市场成功'的主流认知。

    1. A conspiracy theorist might wonder if removing the Ray-Ban branding is an attempt by EssilorLuxottica to distance itself from Meta. Not quite.

      大多数人认为Meta去Ray-Ban品牌化是为了与Meta的隐私丑闻保持距离,但作者暗示这并非EssilorLuxottica的意图,因为眼镜上仍保留其名称。这挑战了公众对品牌合作关系的普遍认知。

    1. At WWDC 2026, Apple repeatedly referenced its privacy-preserving approach to Siri AI. As part of the company's Private Cloud Compute, Apple claims it doesn't store data from users and only pulls from it when you ask Siri a question.

      大多数人认为大型科技公司提供的AI服务必然会收集和存储用户数据以改进产品,但作者指出苹果声称其Siri AI采用隐私保护设计,只在用户提问时才访问数据。这一声明挑战了当前AI行业普遍依赖数据收集的做法,暗示苹果可能找到了一种既能提供AI功能又能保护隐私的新模式。

    1. The cutbacks take place not long after Accenture threatened that employees would 'risk losing out on promotions' if they didn't use AI, 404 writes.

      这是一个值得深入了解的背景信息,显示Accenture在AI使用政策上的矛盾行为。从威胁不使用AI会影响晋升,到限制AI使用的转变,反映了企业对AI价值的重新评估。这一转变的时机和原因值得进一步调查,以及这是否是行业普遍趋势。

    2. The cost of tokens has thrown into doubt the AI business model — as evidenced by what's being called the 'AI selloff' which has battered some AI-dependent businesses the last few days, especially memory chip makers.

      大多数人认为AI技术将创造新的商业模式和巨大商业价值。但作者认为token成本已经动摇了AI商业模式的可行性,甚至导致AI相关企业股票下跌。这与市场对AI技术普遍乐观的看法形成鲜明对比。

    1. These departures are part of a concerning trend for Google. Last week, legendary AI researcher Noam Shazeer announced that he was leaving Google for OpenAI.

      大多数人可能认为Google的AI人才流失是暂时现象或个别案例,但作者将其描述为'令人担忧的趋势'。这挑战了'科技巨头偶尔的人才流失是正常现象'的普遍认知,暗示Google可能面临更深层的人才战略问题。

    2. Last week, legendary AI researcher Noam Shazeer announced that he was leaving Google for OpenAI. Shazeer had been at Google since 2000, save for the three years he spent building his controversial chatbot startup, Character.AI.

      大多数人认为像Noam Shazeer这样的传奇AI研究员会长期留在Google,特别是考虑到他在公司长达23年的历史。然而作者指出他正离开加入OpenAI,这挑战了'忠诚度和长期服务会在大科技公司获得更高回报'的普遍认知。

    1. PHP 8.0.0 起,构造器的参数也可以相应提升为类的属性。 构造器的参数赋值给类属性的行为很普遍,否则无法操作。 而构造器提升的功能则为这种场景提供了便利。

      无需手动声明属性了。

    1. the message is clear: The AI industry isn't immune from U.S. government interference

      大多数人可能认为AI技术的前沿性质使其能够规避传统监管框架,但作者认为政府的禁令明确传递了一个信息:即使是尖端AI技术也不能摆脱政府干预。这与科技行业自认为能够自我监管的普遍认知相悖。

    1. 在军事项目领域,设计并建造下一代战斗机,或者至少造出一架足够优秀的战斗机,是一个国家所能选择的最困难的任务之一。随着过去几年向第六代战斗机迈进的步伐不断加快,我们一再看到证明:启动一个项目远比将其坚持到底要容易得多。俄罗斯的下一代雄心壮志受到了乌克兰战争巨大资源需求的打击,更不用说持续的实质性制裁了。即使在资金充裕得多的美国军方内部,也一直在反复争论如何同时为空军和海军的战斗机项目提供资金。早在2017年,法国和德国渴望拥有自己的下一代战斗机,但又对所需的庞大资源感到畏惧,于是决定联手。2019年,西班牙也加入了该团队。这原本应被视为欧洲合作、资源整合和实现更大战略自主的胜利。它本应避开此前许多跨国项目所陷入的陷阱:投入巨大的时间和资源,试图打造出各方都能接受的东西,结果他们后来又决定分道扬镳,各干各的。多年来,我们一直被告知巴黎、马德里和柏林完全致力于该项目。但从复杂的技术交流和工业安排,到更简单的问题如“这架飞机到底要用来干什么”,各种疑问显然已经公开化。其中一些问题曾在本频道讨论过,这导致了最近的宣布:经过近十年的努力,唯一纯粹的欧洲第六代战斗机项目即将解体,参与方可能会分道扬镳,各奔东西。因此,今天我们将对第六代战斗机竞赛、法德西合作的戏剧性崩溃,以及这可能对另一个部分由欧洲参与的第六代项目——“暴风”(Tempest)意味着什么进行更新,因为它仍在与其最可怕的敌人——英国财政部进行斗争。为此,我们将首先了解更广泛的第六代竞赛的一些背景,并追溯法德西项目从2017年最初的理想主义,到定义它的争论和冲突,直到最终政治领导层不得不接受不可避免的现实,并将该项目像许多跨国项目一样“彻底放弃”的演变过程。然后,我们将把目光转向接下来的选择。首先是法国,然后是德国和西班牙。这不仅包括讨论这些国家在未来战斗机发展方面可能采取的行动,还包括这可能为另一个部分由欧洲参与的第六代项目带来的机遇。

      在我们能够理解为什么其中一个或多个项目最终会解体之前,了解他们试图做什么会有所帮助。战斗机世代并不是绝对的、普遍适用的分类。出于多种原因(包括营销),国家和公司经常有理由在描述上含糊其辞。例如,一些拥有通常被认为是第四代战斗机的国家,可能会声称它们融合了第五代或第六代特征。为了反映随着时间的推移而整合的所有升级和新功能,我们在营销手册和在线材料中看到了新名称的出现,给了我们“四代半”、“四代+”,有时甚至是声称的“四代++”战斗机。话虽如此,总体而言,对于第六代战斗机项目应该实现什么目标,有一些普遍公认的特征。无论你是在谈论美国、中国还是欧洲的思考,人们普遍认为第六代战斗机必须具备隐身性和生存能力,在传感器、计算能力、发电和冷却能力方面相比前几代实现巨大飞跃,提供令人印象深刻的性能,并且必须被设计为“体系中的体系”(system of systems)的一部分来运行。实际上,我们所知道的几乎所有主要项目,以及一些额外的项目(如俄罗斯设想的第六代战斗机),都将与空战无人机并肩作战。这使得有人驾驶战斗机不仅扮演个体战斗机的角色,还扮演生存能力强的传感器和控制节点的角色——基本上是一个高性能的指挥中心,能让几名人类存活下来,以便他们能够协调周围的无人机系统。这就是你如何在战斗机机队中获得“规模”和“弹药深度”的部分途径,尽管这些新飞机可能极其昂贵,并且可能以过去某些第四代飞机那样的数量生产时成本高得令人望而却步。这也是这些项目在开发阶段如此困难且极其昂贵的部分原因。你不仅要开发一种新的战斗机(这对许多国家来说本身就已经足够困难了),还需要开发相关的子系统,开发无人机,并提出网络架构,使它们能够作为一个团队运行。

      这里的一个重要背景是,在许多国家开始着手这些项目的阶段,国防界内部曾有一些争论。你真的需要下一代有人驾驶战斗机吗?还是无人机已经准备好承担更多这类角色了?我认为,在这一点上,大多数主要军事强国已经明确决定你需要。许多主要的机队仍然依赖于迅速老化的冷战时代设计。既然无人机还没准备好,除非你愿意在几十年内没有顶级的空军,否则你可能至少需要再发展一代战斗机。在此之后是否还需要另一代,我们拭目以待。但当我们开始进入空战的“有人-无人协同”时代时,很明显,大多数人预计有人驾驶平台在一段时间内仍将是团队的一部分。如果你想让这个有人驾驶组件有效且具备生存能力,那可能意味着需要第六代战斗机。然而,认为你需要某样东西与能够实际设计和生产它之间存在着巨大的差异。在国防工业努力的难度谱系上,这几乎是最难的了。世界上很少有国家真正展示了设计和建造第五代设计的能力。而这些(第六代)可能会更加复杂。一般来说,如果你试图评估一个国家或国家集团是否有可能在国防工业领域完成某项任务,我认为你通常至少需要三个投入要素:一堆足够大的资金、将其投入火中的政治意愿,以及确保从熔炉中出现的产品物有所值的必要工业和科学能力。这不是那种你可以在车库里拼凑出来的项目。所需的一些技能和经验也不是你随便在招聘网站上发个广告就能招到的。基于这三个标准,除非各国愿意妥协(例如使用进口组件和专有技术,或特许设计),但多年来很明显,只有少数几个主要项目有合理的成功机会。其中许多集中在两个已经设计并生产出完全自主的第五代设计的主要工业强国:美国和中国。美国有两个主要项目:空军的F-47空优战斗机和海军的F/A-XX(旨在取代老旧的F/A-18)。即使在美国这样庞大且发达的国防工业背景下,这似乎也有些吃力。F-47似乎进展顺利,但海军的战斗机项目则波折不断。有时,海军自己提议推迟该项目,以便将资金转移到其他领域。人们还对行业产能表示担忧,因为大量优秀人才和资源被导向了F-47等项目。目前,似乎唯一能让F/A-XX保持当前速度推进的因素是国会。当政府试图将F/A-XX的资金削减到每年约7000万美元时,国会拨款委员会介入,试图额外增加约9亿美元。美国还有一个相对先进的“忠诚僚机”项目,与第五代和第六代战斗机并肩作战。这就是协同作战飞机(CCA)。虽然我们还没有看到生产设计被选中,但资金和优先级显然已经到位。我们还应该向美国致以荣誉的提及,因为它有望成为第一个实际装备下一代飞机的国家,尽管是以轰炸机而非战斗机的形式。B-2“幽灵”的替代者B-21“突袭者”已经飞行了一段时间,有消息称它最早可能在明年有限度地服役。B-21在这里可能相关的原因是,尽管它不是战斗机,但该项目的一些技术和经验教训可能是可以转移的。如果你完成了设计飞机的艰苦工作并转入生产,那可能会有大量熟练的个人可以转移到其他项目上。

      另一个多项目参与者显然是中国。美国空战司令部司令曾表示,美国的评估是,中国正朝着与美国相同的方向发展“体系中的体系”,其中该体系的一部分至少包括一种第六代战斗机的设计。事实上,我们已经看到了来自中国的许多未来派机体,其中一些已经试飞。当然,在装备隐身作战无人机方面,中国在某些方面实际上可能领先于美国。虽然在北京在隐身轰炸机游戏方面仍远远落后于美国,但预计随着轰-20(H-20)项目,他们最终会赶上。除了这两个超级大国,其他在这场下一代航空竞赛中的参与者在哪里?因为虽然许多人谈论过它,但大多数国家都难以满足我们之前讨论的那三个标准。瑞典萨博(SAAB)有战斗机设计的历史,但很难想象他们能找到资金独自承担第六代项目。印度曾谈到在未来将其国内第五代战斗机“先进中型战斗机”(AMCA)融入一些第六代特征,但他们也公开表示,印度空军有兴趣加入另一个第六代战斗机开发项目,而不是完全单干。在2022年入侵之前,俄罗斯有着庞大的下一代飞机雄心,包括飞翼战略轰炸机和第六代战斗机PAK DP。但这些项目现在被可笑地拖延了。由于俄罗斯国防部门的大部分资源被乌克兰战争的需求所吞噬,俄罗斯似乎没有能力在未来真正跟上主要竞争对手的步伐。然而,仍有一个潜在的力量集团可以做到这一点。那就是欧洲,或者更具体地说,欧洲加上几个额外的盟友。你在这里看到的图表非常粗略地衡量了两种GDP:名义GDP和购买力平价(PPP)。当涉及大型国防项目时,两者都很重要。如果你在支付科学家和工程师的薪水,购买力平价可能更重要。但如果你在进口任何东西,或者使用本可以在国际市场上出口的商品,名义GDP可能是更准确的衡量标准。如你所见,无论你进行PPP调整与否,与其他三列相比,俄罗斯真的只是一个“陪跑者”。美国、中国,以及我在这里拼凑在一起的一组国家(包括欧盟、英国和日本)。以名义美元计算,这个拼凑起来的经济集合体大致相当于美国,以购买力平价计算大致相当于中国。将这组国家拼凑在一起的原因是,其他第六代项目大多来自这里。“欧洲及其他”这一列给了我们两个主要的第六代项目。一个主要由英国、日本和意大利组成的联盟正在开发“暴风”(Tempest)作为其体系中的体系的有人驾驶战斗机部分。在纸面上,该战斗机有一个相当激进的测试和服役时间表,首飞定于2028年,服役定于2035年。而且在纸面上,涵盖了许多工业和技术基础。你有像MBDA这样的武器公司,意大利人负责传感器,罗尔斯·罗伊斯负责发动机,而日本能够带来大量的材料科学组件和其他专有技术。所有这些国家都有操作第五代战斗机F-35的经验,并且是其更广泛供应链的一部分。他们之间还拥有生产先进作战飞机的大量现有能力。另一个项目是FCAS(英文)或SCAF(法文),最初结合了德国和法国,几年后西班牙加入。请记住,当我以后提到SCAF时,我通常只指代“体系中的体系”的一个组成部分,即下一代战斗机,这让我们回到SCAF原本应该是什么。首先要说的最重要的一点是,该项目诞生于与今天截然不同的政治和安全背景下。德国的军费开支要低得多,虽然克里米亚事件已经发生,但对俄罗斯军事活动的威胁看法与2022年之后截然不同。这或许提供了一些有用的背景,解释了为什么该项目最终是这样构建和推进的。这里有非常真实的军事需求,但也有政治和工业激励。在纸面上,这将是一个欧洲项目,旨在开发我们讨论过的完全那种空战“体系中的体系”。与中国、俄罗斯和美国不同,下一代组合中本不应该包括有人驾驶轰炸机,这显然节省了一些资源。但许多其他功能本应存在。本应有一个统一的战斗云,使两支空军和所有这些系统能够共享信息并有效地协同作战。利用该云,还有一个无人机系统与有人驾驶飞机并肩作战。

      几年前我们第一次谈论该项目时,法国人和德国人采取的方法似乎与美国等国家略有不同。像美国的CCA、中国的“利剑”、俄罗斯的“猎人”或澳大利亚的“幽灵蝙蝠”基本上在成本和规模上更接近微型无人机。而欧洲的努力主要谈论的是他们称为“远程载体”(remote carriers)的东西。这些看起来更像是弹药,而不是昂贵的可回收无人机。基本上,多用途的导弹大小的物体,可以由战斗机部署或从运输机尾部推出,携带各种潜在的有效载荷,无论是传感器、干扰器还是某种进攻性弹药。这可能使欧洲模式不如美国方法那样可重复使用和可持续,但也意味着你可以负担得起大量的远程载体,并能够为特定交战产生巨大的规模。然而,随着时间的推移,不同项目之间的差异似乎有所减小。欧洲人保留了远程载体的概念,但他们也开始谈论CCA思路中更大的可重复使用系统。例如,空客在2022年展示的这个概念,是一种更大的、模块化的、可重复使用的无人机,能够根据任务换装不同的传感器,并携带不同的内部有效载荷。其中包括干扰吊舱、中距空对空导弹、联合攻击弹药、“长矛”(SPEAR)导弹,而且根据那张幻灯片,还包括一对较小的远程载体,所以你可以“在无人机里放无人机”,从而稍微接近那种乌克兰战争中的“俄罗斯套娃”无人机体验。然后,在这个空战系统的中心,将是一架有人驾驶的下一代战斗机。对法国来说,这将增强并最终取代“阵风”(Rafale)。对德国空军来说,这可能会取代“台风”(Eurofighter),并在未来与该空军的F-35并肩作战。就努力背后的工业专有技术而言,可以说有很多有利因素。参与的一些大名字背后有很多资历。达索、空客、英德拉(Indra)。有MBDA等公司提供的导弹,你很难出错,而下一代战斗机发动机将汇集除罗尔斯·罗伊斯外的一些欧洲公司,这些公司可能具备实际完成这项任务的技艺和经验。法国的赛峰(Safran)在“阵风”的动力装置上证明了自己。另一方面,德国的MTU就是其中两个例子。因此,在纸面上,你有一个联盟,结合了法国最近在“阵风”等飞机上的经验、德国的工业实力和支票簿,以及来自跨国公司或联盟其他成员(如西班牙)的一些关键贡献。然而,过去当我们谈论俄罗斯以外的第六代战斗机项目时,这一直是我描述为“基础最不稳定”的项目,下一个显而易见的问题是:为什么?事实是,SCAF多年来一直公开处于“生命维持”状态。虽然特别是在工业方面,这将是一场紧张的离婚,无疑会导致来自半个地球之外的评论区进行一些有趣的讨论,但在SCAF和成功之间似乎总是有两个主要的地雷,而它成功地依次踩中了这两个地雷。

      第一个是,尽管花费了所有的金钱和时间进行范围界定会议、讨论、发表的论文、协议、新闻稿和开发工作,但没有真正的证据表明参与方曾经能够回答一个相当基本的开发问题:下一代战斗机到底应该是什么?因为虽然所有参与方似乎都同意这可能是一种某种形式的隐身飞机,大概能够携带爆炸物并让其他飞机爆炸,但除此之外,基本要求似乎发生了冲突,对这架飞机应该是什么样的愿景变得有些模糊,部分问题又回到了这样一个事实:参与国试图取代具有非常不同理论角色的非常不同的飞机。对法国来说,这需要是下一代“阵风”,一种多用途、具备核能力、能够从法国下一代航母上起飞的舰载战斗机,能够部署ASMP-A和下一代核武器,执行空战任务,并大量参与对地打击。除了几枚共享核武器的B-61重力炸弹外,德国空军没有核武器,也绝对没有航母。那么他们想要的实际上是一种大陆空优战斗机,一种能够保卫德国和盟国领空,并可能与无人机僚机一起与俄罗斯空天军正面交锋的飞机。有一些证据表明,这种差异并不小,而且两国也很难克服。对法国来说,有充分的理由相信他们所追求的要求将是根本性的。你不可能指望像“阵风”这样的第四代飞机永远飞行,并期望无论应用什么升级它都能保持生存能力。考虑到法国预算和工业的限制,不可能想象他们既能生产第六代空优战斗机,又能生产第六代舰载和核打击战斗机。如果他们想保持航母国家的地位并保持其核理论不变,巴黎就需要SCAF成为真正的第六代“阵风”。我认为这不是简单的固执,也不是你可以指望谈判代表轻松解决的问题。这是法国永远难以妥协的核心战略任务的一部分。对项目官员的采访确实表明,人们相信未来的战斗机将比“阵风”重得多。人们还理解,操作这些飞机的未来航母需要比现有的“戴高乐”号更大,我们已经从法国下一代航母计划中看到了这一点。但巴黎总是会遇到难以逾越的工程红线。但德国也公开明确表示,那不是他们真正需要的飞机类型,而制造那种飞机所涉及的工程让步将使其对德国空军来说用处降低。正如德国领导人默茨公开说:“法国人在下一代战斗机中需要一种能够携带核武器并从航空母舰上起飞的飞机。这不是我们目前在德国军队中需要的。”鉴于这些国家显然不愿意考虑解决这个“方枘圆凿”问题的最搞笑的潜在解决方案——即给德国配备航空母舰和核武器以使要求保持一致——这似乎多年来一直是该项目活跃期间的一个争论和摩擦点。事实上,事情在今年2月达到了一个顶点,相关领导公开开始谈论所谓“双战斗机解决方案”的可能性,即SCAF的下一代战斗机部分不会生产一种,而是两种不同的设计,以更好地满足法德要求。毫不奇怪,许多利益相关方似乎并不热衷于重蹈F-35A/B/C的覆辙。因此,双飞机解决方案似乎并没有真正起步或成功缓解工业紧张局势。虽然现在提出这种需求分歧的解释是为了帮助解释该项目的消亡,但在我们继续之前,还有一点需要说明。如果这在近年来是一个重大问题,那么它本不应该让任何参与方感到惊讶。法国人并不是在一开始就没有明确表示他们希望这东西能够从航母上起飞并具备核打击角色。德国也没有完全隐瞒他们不打算在不久的将来推出福特级航母副本的事实。我们确实有证据表明,飞机的可能尺寸及其必要能力一直在讨论中。你会发现可以追溯到2019年的文章和采访,证实SCAF的下一代战斗机组成部分将是一架具备航母起降能力的飞机。该项目中的各方始终了解围绕要求的潜在紧张关系,就像他们可能也了解工业份额方面会有一些争论一样。

      说到工业紧张局势,那是这个项目道路上的另一个真正的地雷。与许多跨国国防项目一样,参与国政府可能真的希望项目成功,财政部也支持它,因为分担成本是有意义的,确实如此。然而,一旦你让公司参与工业规划,它很快就会变成一场堑壕战。在SCAF的案例中,这似乎发生了。从根本上说,这里的一些问题归结为这样一个事实:你经常谈论的是可能成为竞争对手的公司必须在一起工作。因此,他们经常将此视为零和游戏,不仅针对该项目,还针对他们更广泛的竞争。这可能会以多种方式表现出来并毒化谈判。首先是工作份额(workshare)。在理想世界中,双方都希望对方为项目买单,但自己的公司实际建造它。他们想要工作机会。他们想要投资。他们想要积累的知识产权。他们只是不想要账单。虽然所有参与方都可以根据对自己方便的情况用不同的术语来掩饰这一点,无论是公平还是能力,但最终的问题是,你通常面对的是零和游戏。如果有人负责制造发动机、机翼或特定组件,其他人就不会去做。如果你只是将所有组件五五平分,你最终会得到一个效率极其低下的项目。在某种程度上,SCAF试图通过“最优者得”(best athlete)概念来绕过这一挑战。但即使你普遍同意领导特定工作流或组件的公司应该是该任务的最佳人选,这也不一定意味着争论的结束。这甚至还没有涉及到分享技术和专有技术的问题。将多个国家和多家公司聚集在一起的原因之一是他们拥有不同的技术、不同的经验、他们可能带到桌面上的不同事物。如果每个人都愿意将他们的经验和技术摆在桌面上,他们有可能共同建造出比分开工作更令人印象深刻的东西。问题是,公司通常不喜欢分享这些东西,特别是与潜在的竞争对手。这绝不是一个新现象。例如,在第二次世界大战期间,当波音被告知将其他公司引入B-29供应链以加速生产时,简而言之,该公司并不太热情。B-29是当时非常先进的设计,他们的观点是,他们基本上被要求为战后市场培训竞争对手。现在,鉴于美国正在进行战争,美国政府基本上转过身说“ tough,把飞机造出来”。但在2026年非常不同的环境下,对政府来说,这并不总是那么容易。即使一个项目能找到解决这个问题的方法(有些项目确实做到了),还必须应对跨国国防项目失败的另一个“精选集”:争夺谁控制该项目。冒着极大简化基于已公开内容的风险,达索认为,因为他们是SCAF有人战斗机部分的主要系统集成商,他们应该对该部分享有重大的实际控制权,包括供应商选择以及达索首席执行官特拉皮耶(Trappier)描述的“明确的领导权”,即使法国和西班牙可能在整体项目桌上以人数优势否决法国。达索提出了几个论点,即明确的领导权将有助于事情更快地推进,并且他们最近有实际开发战斗机的相关经验,这是真的。试图通过委员会进行设计和管理已经拖延或破坏了许多过去的宏伟项目,这也是真的。因此,如果有一个单一的一方负责,项目可能会更快、更果断地推进,这可能是真的。另一方面,空客似乎辩称这是一个跨国项目。其他公司带来了很多东西。这里涉及的大量资金将是德国和西班牙的,而不是法国的。因此,从公平的角度来看,这些国家和公司有很多发言权是合理的,我冒昧地说,这也是真的。欢迎来到跨国国防项目的奇妙世界。对于许多这些问题,皮球被一再踢来踢去,直到最终它们终于爆发。从历史上看,当跨国开发项目开始出错时,通常的一个大线索是,一些参与方(企业或政治)开始游说分裂。在冷战早期和中期,例如,法国和英国有许多成功的联合开发项目,包括著名的“美洲虎”。但当谈到开发英法可变后掠翼飞机时,法国最终退出了该项目,表面上是因为成本,这最终帮助英国进入了另一个跨国项目,即给我们带来“狂风”的项目。MBT-70是一个冷战时代的坦克开发项目,旨在将西德和美国聚集在一起。最终结果是双方都吸取了一些开发教训,但最终决定各走各的路。美国最终开发并采用了M1“艾布拉姆斯”,德国则采用了“豹2”。也许是一个与最近事件更相关的例子。在20世纪80年代初,法国最初与意大利、西班牙、西德和英国一起参与了“未来欧洲战斗机”项目。然而,除其他争论外,法国通常想要一种相对轻量级的多用途飞机,能够从航空母舰上起降,而英国,你猜怎么着,想要一种相对重型的地基空优战斗机。所以,是的,在某些方面,我们以前看过这部电影,结局是法国单干开发了“阵风”,而项目的其他成员最终开发了“台风”战斗机。如果你关注一些最近的事件,你可能已经开始看到与之前一些崩溃类似的紧张和躁动。到去年年底,一些参与的关键工业冠军基本上在争辩说他们可以单干。达索首席执行官特拉皮耶表示,他们拥有单独开发新型喷气式战斗机的专有技术和能力。本质上,这一声明归结为指着空客说:“我们真的不需要你,所以跟上吧。”就他们而言,至少有一位空客领导人公开站出来,基本上在另一个方向上暗示了同样的意思,暗示如果没有达索,开发新型战斗机可能会更有效率,绕过法国不一定会损害法德关系,没有法国的项目可能允许更快地重新设计和建造新飞机。你必须记住,从企业激励的角度来看,这两位领导人都不一定是错的。事实上,在真空中,你可以争辩说他们只是在保持理性。与跨国努力相比,国家项目将使这些主承包商获得更多的份额,不必分享他们的技术,并且在管理方面也会容易得多,因为 proverbially 厨房里不会有那么多“厨师”。放弃跨国项目的大部分缺点只在国家层面累积,而不是在单个公司层面。当你走向跨国时,你可能会节省大量资金,但这是由政府和纳税人支付的,而不是参与的公司。事实上,如果他们单干,他们可能会赚得更多。最终的设计也可能更好,因为你结合了来自多家公司和多个国家冠军的技术。但一家公司可能更愿意生产一架自己制造的“足够好”的飞机,而不是一架必须与他人分享的“优秀”飞机。换句话说,在观看围绕这类辩论的报道时,请确保记住,虽然对参与公司来说最坏的情况可能是项目取消和工作蒸发,但有一种观点认为,最好的情况通常是与跨国项目离婚,整个项目完全由国家财政部资助,100%的工作留在国内。我想清楚地表明,在这些宏观的、简化的观察背后,这里还有很多事情发生。有很多来回拉扯,很多机动,努力的不同部分之间有很多动态。例如,我们只谈论有人战斗机,而不是关于无人机或战斗云的工作份额或谈判。但在宏观层面上,这些是我过去已经指出的一些使该项目基础不稳定的大问题:存在争议的要求和痛苦的工业关系,这需要广泛的政治压力才能推进。公平地说,我们确实看到了一些这种情况。参与国的领导人多次会面,试图解决问题。西班牙将该项目描述为受到“政治和工业傲慢”的威胁,并在最终结果落地时公开表示遗憾。但这些国家最终似乎未能说服参与公司达成可行的协议。因此,在一次次会议、一次次踢皮球之后,在过去几天里,他们终于同意就此打住。SCAF的有人战斗机部分被公开宣布死亡,柏林、巴黎和马德里迅速转向强调该项目的其他部分。例如,据报道,战斗云仍将开发和实施。许多无人机项目也可能被推进。但最终,这现在看起来像一个没有空优战斗机的多国空优项目。因此,虽然很多注意力已经转向对下一步的疯狂争夺,但我认为值得在此刻强调,无论接下来发生什么,参与方可能失去了什么。

      在硬性要素方面,两个明显的损失是时间和金钱。多年来,花费了大量资金试图使该项目奏效。虽然其中一些努力可能是可转移或可回收的,但其中一些最终将丢失。在2022年入侵后世界的疯狂重新武装争夺中,很难仅仅嘲笑一个已经进行了近十年的项目的损失。在军事上,现在这些部队可能面临进一步延迟获得他们认为需要的战斗机的情况。由于双方之间失去了一些技术共享,当它到来时,它可能没有那么强大。在软因素方面,也很难超越象征意义和主权的问题。这是唯一真正的欧洲跨国努力。如果SCAF成功,它将象征着欧洲一些主要国家和经济体合作并生产世界级国防硬件的能力。它可能会减少对从其他地方(特别是美国)进口的技术和硬件的依赖,帮助通过对抗俄罗斯改善军事平衡,并弥合自F-22和F-35出现以来一直存在的与美国之间的军事工业技术差距,而没有真正的欧洲主权等价物。有可能,一些人甚至会争辩说很可能,在SCAF的位置上,其他东西将取而代之。但对于一个试图在重新武装时代重申自身的欧洲国防部门来说, Suffice to say,即使该项目可能在一段时间内注定要失败,这绝不是一个光荣的时刻。

      因此,随着战斗机项目被击落,尘埃落定,主要参与者接下来会发生什么?在这里,我将首先看看法国。因为在某些方面,三个参与国中,法国的下一步行动可能是最容易预测的。无论如何,尽管该项目崩溃了,法国可能会继续推进下一代战斗机的开发。虽然其他国家仍在公开权衡他们的选择,但这已经是他们说过要去做的事情,法国国防部长表示,他们打算利用已经投入该项目的成果,并继续开发战斗机直到2040年。谈到未来的战斗机,她据报道说:“这显然是我国主权的一项重大技术资产。”我包括这条评论是因为它暗示了为什么我们应该期望法国会继续推进,也是为什么达索可能如此有信心将这件事斗争到底的原因之一。你应该期望法国政府推进第六代战斗机,因为在很大程度上他们真的没有其他好选择。与德国人不同,法国人的机队中没有他们可以潜在依赖的第五代战斗机。也许希望无人机能弥补第六代有人战斗机最终提供的一些能力。而且他们也是主要的出口国。武器出口是法国外交政策的一个主要元素,是法国国防工业经济的一个关键因素。一些法国领导人强调了该部门可能具有的分量。正如一位前法国官员据报道所说:“达索不容易。他们有惊人的工程师,但在政治方面,他们随心所欲。”但是,为了在全球范围内拥有一个繁荣、有利可图的出口部门,你需要有人们想要购买的产品。现在,对一些客户来说,“阵风”可能符合要求。但随着时间和技术的进步,你只能将这么多的升级塞进一个相对昂贵的第四代平台中。例如,你不能只是给“阵风”加个“车身套件”就让它变成隐身飞机。随着越来越多的第五代甚至第六代战斗机在全球市场上变得可用,法国航空部门不能永远靠这种设计吃老本。他们需要新的东西。这并不意味着法国人不一定会在项目中寻找其他合作伙伴,尽管可能是那些愿意提供资金以换取项目参与权的人,而不一定是德国人和西班牙人所期望的同等水平的工业参与或技术交流。例如,印度有一些声音,印度操作着庞大且不断增长的法国战斗机机队,他们表示尝试介入并接手部分工作可能符合印度的利益。印度军方过去曾公开表示有兴趣加入跨国项目之一,无论是SCAF还是GCAP。但我认为值得注意的是,这个想法的任何实际执行可能还有很长的路要走,并且可能会面临一些与导致原始项目崩溃相同的地雷。例如,印度和法国最近进行了紧张的谈判,因为法国非常渴望向印度出售“阵风”并在印度制造中拥有重要的工业参与,但他们不愿意交出战斗机系统的源代码。同样,法国和阿联酋之间关于共同资助“阵风”F5升级包的协议最近也破裂了,据报道部分原因是阿联酋期望从法国获得更多的技术交流以换取他们的财务贡献,而法国不愿意提供。换句话说,我预计法国人会表示他们非常公开地欢迎多国参与他们未来的战斗机项目。但魔鬼在细节中,必须克服这些细节才能使这真正发生。

      现在,从纯粹的技术角度来看,法国设计和制造满足其要求的第六代战斗机的想法可以说是完全合理的。在某些工业能力领域,他们可能落后于市场上的一些其他参与者,但他们多年来一直设计和制造自己的飞机。然而,根据迄今为止开源可用的信息,我认为这种表达出的信心应该至少带有两个警告。首先,即使法国推进法国设计的战斗机,这最终也不太可能成为完全法国的能力。正如我们之前指出的,合作伙伴目前表示他们打算推进其他联合开发领域,如战斗云和潜在的无人机。因此,法国最终可能会得到一架主要是法国的战斗机,但它真正依赖于跨国工具套件才能发挥最大效用。但更紧迫的是设计本身,我对发动机有一个问题。一般规则是,战斗机发动机很难。它们通常是一个国家最终成功实现国产化的最后一样东西,即使他们开始提出自己的设计。这也是为什么你可能会看到韩国人或瑞典人制造的战斗机使用美国发动机,而发动机是中国成功取代俄罗斯进口的最后几个领域之一。法国人确实有为“阵风”配备的国产战斗机发动机,但它不符合你期望用于第六代战斗机的规格。因此,作为更广泛的FCAS项目的一部分,不仅有一个多国项目来设计飞机。还有一个多国项目来设计新发动机。所以,我还没有看到确切答案的一个问题是:这东西会怎样?最经济的机制可能是推进现有的多国安排。但从巴黎的角度来看,这意味着你最终可能会得到一架配备多国发动机的法国战斗机,此时这就变成了一个问题:为了国际合作和推测的国际资金,你愿意放弃多少国内工业主权?因为这里是第二个打击。虽然达索可能有理由在技术上自信他们能设计和制造具有国际竞争力的第六代战斗机,但他们不是必须弄清楚如何为其提供资金的人。描述当前法国国防工业基础的一种方式是“技术上有才华但财政上岌岌可危”。法国对国防主权的方法带有巨大的价格标签。例如,该国需要负担得起自己的太空资产、核武库、这些核弹的运载系统,以及一系列加起来构成相当昂贵的支出计划的国防优先事项。早在2023年,法国政府就在谈论大约5年4400亿美元的军费开支计划。那还是在世界上SCAF潜在的1000亿美元以上的价格标签将由多方分担的背景下。如果没有柏林和马德里来支付部分账单,如果巴黎确实想以最小的改变和对项目的完全控制来推进,他们将不得不找到资金来弥补一些差额。而在2026年,这并非易事,因为法国的公共财政看起来不太妙。法国目前的公共赤字约占GDP的5%,当前累积的政府债务与GDP之比约为115%。现在,假设法国要提高支出以达到北约3.5%的新国防目标,你可以潜在地想象战斗机支出来自该预算份额。但在纸面上,各国有数年时间才能达到该目标。在这种具有挑战性的公共财政背景下,可能很难在沙发垫子后面找到额外的100亿或200亿欧元。那么这里的粗略总结可能是:我们应该期望法国希望推进战斗机设计。他们说过他们想推进战斗机设计,但为了使这奏效,某些或多件事可能必须让步。他们可能必须牺牲一些主权以引入额外的资金或合作伙伴。他们可能牺牲政府赤字,不惜一切代价找到资金。或者你可能会看到战斗机本身的改变,可能缩减其能力和潜在的采购数量。当然,潜在的变数可能是出口市场。在很大程度上,“阵风”对法国政府来说之所以如此负担得起,生产线之所以如此健康,是因为出口。因此,你可以想象法国推进战斗机项目,希望(正如我们看到俄罗斯人所做的那样)外国客户将承担部分成本。然而,那里的问题通常是,在你的客户同意签字画押并交出现金之前,他们希望看到你已经有了一个获胜的产品。这意味着法国人可能必须先推进并实际开发战斗机,并承担所有相关成本。本质上是赌博,一旦他们做到了,他们就可以将其推向市场并赚回一些成本。最终这对某些项目有点奏效,但在相当长的一段时间里情况有些岌岌可危。因此,我认为仍有待观察,传统上一直相当保护其某些高端技术的法国政府将如何处理潜在出口该国有史以来最先进的航空航天产品的话题。

      然后你有了德国的问题,在某些方面,你实际上可以争辩说他们比法国人有更多的选择。他们不那么依赖拥有面向国际市场的战斗机。加上他们的机队和财务状况也看起来非常不同。因此,虽然这不是一个详尽的列表,但我认为有三个主要的德国选项我们可能想要探讨。第一个是干脆不开发第六代有人战斗机。默茨已经公开质疑二十年后空军是否仍需要它们,因此这是否是当前必要的投资。如果德国确实决定让大部分努力消亡,问题是你接下来会做什么?最可能的答案可能只是继续依赖第四代和第五代混合机队。你保留“台风”战斗机,可能采购更多,然后为了填补原本可能由SCAF覆盖的部分生态位,也许你购买更多的F-35。F-35可能不完全符合他们希望下一代战斗机能够做的事情,但在许多方面,包括隐身性,它可能比“阵风”或“台风”更接近。这里的优势是,你跳过了一个昂贵且潜在风险很高的开发项目。你选择你已经操作的设计,并继续享受与操作这些相同平台的其他盟友的互操作性优势。外面仍然有一堆“台风”战斗机,欧洲F-35的数量继续飙升。这里明显的紧张局势是,这在某种程度上有点违背了德国声明的优先事项,即更大程度独立于美国的国防。如果目标是重建德国国防部门并作为一个国家和大洲变得更加自给自足,投资数十亿美元在未来几十年加倍押注美国设计,可能不完全是脑海中浮现的第一个选项。所以这绝对是德国国防部长表示该国可能正在考虑的一个选项,但不是唯一的选项。皮斯托里乌斯确实暗示该国可以购买额外的F-35,但他列出了两个潜在的替代途径。第二个是用另一个欧洲跨国战斗机项目取代一个欧洲跨国战斗机项目。只是这次没有巴黎,柏林处于更核心的位置。不出所料,这已经是德国工业特别似乎在潜在推动的一个角度。空客防务与航天公司公开启动了其“Team Gen 6”倡议,八家主要的德国国防和航空航天承包商签署了一份战略立场文件,其隐含的意思似乎是柏林要保持第六代梦想,只是在德国领导下,可能在后SCAF争夺战中继续让西班牙非常密切地参与工业。我们还看到了关于其他潜在合作伙伴的公开讨论。这里一个有趣的例子是瑞典,一个拥有自己现有第四代战斗机的国家。萨博公司受委托对第六代战斗机概念进行至少一些研究,但可能不是一个单独拥有必要的财政和工业实力以高效规模推进第六代项目的国家。从柏林的角度来看,朝这个方向发展有几个可能使其具有吸引力的因素。如果你试图让你的国防制造商在国际地图上占有一席之地,第六代战斗机项目可能会做到这一点。将其主要保持在内部将简化工作份额协议和技术交流,同时德国人也将对飞机的规格有更多的控制权。基本上,这里有更多机会让他们设计出他们想要的战斗机。当然,挑战正是你所期望的。延迟、关于能力和时间表的疑问。列表还在继续。与法国相比,德国人在财政状况上可以说好得多,可以为此提供资金。德国的债务水平要低得多,借贷成本更低,并且其军事预算预计将大幅增加,这已经使其跃居法国之前。但根据你的观点,这也可能使现有问题变得更糟。在SCAF崩溃之前,争论是欧洲真的没有从拥有两个不同的第六代战斗机项目中获益。考虑到即使是美国在并行运行两个项目时似乎也在经历压力,一些人建议,从联盟的角度来看,最好的方法是合并努力并将其缩减为一个。如果SCAF解体,只是为了法国人和德国人都朝不同方向继续,那么已经碎片化的欧洲第六代努力将进一步分为三个,这可能解释了德国国防部长暗示的最终选项:德国加入其他现有的第六代努力。现在,虽然皮斯托里乌斯只说这个选项将涉及德国加入现有的具有第六代特征的国际战斗机项目,但我认为你不需要成为侦探就能看出柏林可能不是在谈论与北京签约或试图投资资金重启俄罗斯的PAK DP。试图签约美国F-47项目几乎肯定是一个死胡同,并且违背了更大欧洲自力更生的理念。通过排除法,只剩下一个主要候选者。如果德国(可能还有西班牙)考虑转向“暴风”(Tempest)会怎样?因为在你们开始深入研究诸如德国在一个相当比SCAF更先进的项目中的工业参与可能是什么等棘手问题之前,从纯粹的军事和财务角度来看,你可以看到为什么这里会有一些吸引力。根据我们目前所知的,德国空军想要的与“暴风”可能成为的东西之间的要求可能比SCAF内部德国和法国偏好之间的要求更接近。记住,三个主要的GCAP参与者是日本、英国和意大利。英国基本上想要一种相对重型的第六代空优战斗机来取代“台风”,并在未来与F-35和无人机并肩作战。相比之下,意大利想要一种相对重型的空优战斗机来取代“台风”,并在未来与F-35和无人机并肩作战。猜猜怎么着?德国的主要要求可能也是想要一种相对重型的空优战斗机来取代“台风”,并与F-35和无人机并肩作战。这显然使日本成为项目中的局外人,因为他们正在寻找一种相对重型、远程的空优战斗机来取代各种第四代战斗机,并与F-35和无人机并肩作战。这里没有人想要舰载机。他们用F-35来做这个。这里没有人想要核打击飞机,因为这与他们无关,他们用F-35来做这个。可能仍然会有差异。例如,日本人可能比意大利人更看重航程,但这更多是在边缘问题上。根据我们迄今为止听到的,“暴风”的目标是一种相对强健的飞机,内部有效载荷大约是F-35的两倍,航程也远得多。这很重要的原因是,即使德国将迟到加入该项目,可能太晚而无法对飞机的基本特征有太多投入,但因为现有参与者拥有非常相似的机队、非常相似的要求和非常相似的偏好,有理由相信,从大局来看,从德国的角度来看,这架飞机可能足够接近。它可能不完全是德国领导层如果可以挑选和偏好时会提出的东西,但它具有相当接近实际存在的优势。还值得注意的是,作为联合开发合作伙伴,德国、英国和意大利实际上有很多历史渊源。他们共同开发了非常成功的“狂风”,建造了近一千架,还有“台风”战斗机,这三个国家都继续操作。基本上,虽然跨国项目本质上可能具有挑战性,但这些国家以前已经证明他们可以完成它。从军事角度来看,提议的时间表也更具吸引力。你可能已经注意到,欧洲规划者在重新武装方面感到有些时间压力。部分得益于日本对2035年服役日期的极度关注,“暴风”本应比延迟的SCAF有人战斗机部分早得多到达。这意味着从德国军方的角度来看,这可能是一种比你以为能得到的时间更快地获得更接近你想要的飞机的方法。它还将缓解纯德国或德国主导的努力中可能存在的工业能力方面的许多风险。在各个参与公司之间,他们可以说已经涵盖了所有主要基础。在某种程度上,这实际上可能代表了德国加入该项目的最大障碍之一。德国人,特别是德国工业,可能希望在他们下一代战斗机的生产中拥有重大参与。但正因为“暴风”进展更快,许多工业份额的讨价还价已经发生。所以,如果你确实希望德国公司重大参与,比如提供一些组件或组装德国版本的战斗机,那需要进行谈判、规划和设计。正如我们在法德努力中看到的那样,有时说起来容易做起来难。当然,有可用的工具来做到这一点。即使你无法平衡单个国防交易,你也可以使用称为“补偿”(offsets)的东西来试图平衡整体情况。例如,你可能同意德国人在战斗机中的工业参与少于他们喜欢的程度,但仍然购买它。但作为交换,其他参与者可能会大量购买德国装甲车或德国弹药,并帮助平衡整体账本,而不是将每个单独的项目变成一场工业堑壕战。但正如我所说,即使这些事情在经济和军事上都有意义,有时也是说起来容易做起来难。我们已经从现有“暴风”承包商的声明中看出了一些端倪。例如,意大利重量级企业莱昂纳多的首席执行官公开欢迎德国加入该项目的可能性,称:“在能力和成本分担方面,这将是一件好事。”但同时也发出了关于重新打开工业份额潘多拉魔盒的隐晦警告。“人们还必须考虑到2035年让飞机飞行的目标日期。”罗尔斯·罗伊斯也持积极态度,表示虽然这是政府的问题,但公司绝对对德国加入该项目持开放态度,并强调更多像德国这样的国家加入将给该项目带来它迫切需要的东西之一:保证的规模。“但GCAP的好处将超越于此。更多国家加入意味着更多国家肯定会购买,因为你不能成为合作伙伴而不购买。”虽然你可以争辩说,从德国的角度来看,决定可能更复杂,在那里他们愿意牺牲控制权以换取规模和更大的泛欧及国际合作,但如果你从伦敦的角度来看,这可以说是一个梦想成真。不仅因为它给法国人带来了模糊的不适,还因为这对英国工业来说隐含的巨大机遇。我从三个角度这么说。首先,在英国剩余的高价值产业中,战斗机制造仍然是其中之一。英国及其公司仍然拥有一些在海外供不应求的能力,制造战斗机发动机和喷气式飞机就是其中之一。从工业角度来看,“暴风”非常重要。目前参与制造“暴风”的大量熟练劳动力和供应链正忙于建造“台风”战斗机。在某种程度上,你可以争辩说,该工业系统的一部分一直在靠几个出口订单(如最近向土耳其的订单)苟延残喘,期望“暴风”很快就会到来。如果你不让他们制造东西,你就无法保持工厂和劳动力在一起。一旦你失去了他们,就很难将能力重新组合起来。引入德国可能会增加一个额外的客户、更多的资金、更多的技术,并为该项目提供更大的规模经济机会。这甚至还没有考虑到出口市场。这样想吧。如果你假设认真对待防空的国家最终可能想要第六代战斗机,特别是如果他们目前不操作第五代,他们的选择会是什么?对大多数国家来说,俄罗斯选项可能因为不存在而被排除,这给你留下了F-47和中国出来的任何东西。对许多国家来说,购买中国国防硬件在外交上还不太可行。而对于美国设计,首先,不能保证美国人真的会同意出口F-47。记住,F-22从未出口过。其次,即使它可用,目前国际市场上有很大一部分,包括在欧洲,可能愿意支付溢价以减少对美国的依赖并避免ITAR(国际武器贸易条例)产品。传统上,你可能会看到对“阵风”和“台风”等欧洲设计的需求。但如果现在法国项目可能会放缓,并且更专注于轻型舰载战斗机而不是重型空优战斗机,如果英国、意大利和日本(可能还有额外的合作伙伴)能够坚持该项目并在2035年实际将飞机投入服役,他们真的有可能在竞争对手之前数年进入国际市场,推出第一款非美国和非中国的第六代战斗机。如果你在这些条件下还不能达成销售,你需要更好的推销员。从现有参与者的角度(特别是英国)来看,这里的梦想是,通过现在支付开发项目的一部分份额,你可以潜在地从全球外交发展中获益,包括法德西努力的崩溃,以便潜在地锁定国家使用他们可能操作数十年的平台,并确保你的高价值出口产业在21世纪中叶之后的未来。另一方面,未能将第六代设计推向市场可能会带来巨大的出口风险。英国和法国的主要战斗机出口都是第四代战斗机,分别是“台风”和“阵风”。但就像你不能靠永远出售同一个出色的设计来经营业务一样,诺基亚3310,有人记得吗?最终,如果这些国家想保持其出口产业,他们将需要新产品。不仅仅是美国的F-35在外面作为竞争对手。还有像韩国和土耳其这样的国家在外面提出新的可供出口的战斗机设计,融合了一些你不能仅仅改装到“台风”或“阵风”上的新隐身特征。国际竞争并没有变得更容易。因此,如果英国想保持竞争力,就有很大压力要提出新东西。随着SCAF的消亡,“暴风”商业未来的一个威胁可能已经消失。然而,不得不说的是,对英国项目来说,一个非常重要的威胁仍然存在,那就是,当然是英国。

      现在,我一直在等待对英国进行我的国家级研究,直到国防投资计划的发布。这基本上是英国预计在未来几年在国防上花费多少以及预计花在什么上的大纲。它最初定于2025年秋季发布。随后被一再推迟。我需要强调,我们还不知道里面确切有什么。但尽管围绕它有一些保密性,我们得到了一些线索,内容显然如此“好”,以至于最近促使英国国防部长辞职抗议。在一封公开信中,前国防大臣表示,该计划“远远达不到在这个危险时期保卫国家所需的要求。额外的支持被推迟了,而行动的压力和加快战斗准备的必要性是在头两年,到2030年它仅上升到GDP的2.68%,明年我们将达到2.6%,这是我们已经在做的投资。”他在给首相的信中继续说:“在向你解释我不会接受一个不给我们的部队提供他们所需资源的国防投资计划后,我现在别无选择,只能提交辞呈,辞去你的国防大臣职务。”在国防大臣辞职后,武装部队部长阿尔·卡恩也很快随之辞职。那么,伦敦的所有这些争吵与大陆欧洲项目的崩溃有什么关系呢?答案是,虽然我们还没有看到最终计划,但传闻和报道的包含内容之一是对“暴风”资金的延迟。根据右边的文章,提议不是取消新战斗机,而是把皮球踢下去,延迟资金,在比原计划晚几年后才释放,并且直到2030年代末甚至2040年代才开始采用该战斗机。从政治角度来看,这将避免任何暗示你实际上取消了战斗机,同时方便地将未来支出移出你的前瞻投资计划,并使其成为未来政府的问题。当然,显而易见的一点是,对于这样一个有许多活动部件的项目,你不能只是把它放在停滞状态,然后当你想的时候再把它拉出来。如果你放慢速度,它将对武装部队、盟友和工业产生连锁反应。在外交上,你依赖部分资助和建造这个东西的盟友,特别是日本,一直坚决要求2035年的服役日期。那是因为那符合日本的军事需求。正是那个日期让他们最初同意这个过程的一部分。所以,如果你出现在东京说:“嘿,伙计,我知道我们同意2035年作为目标,但你知道,现在资金有点紧张,你介意我们等一等吗?”你不会赢得任何外交分数。同样,除非你非常小心,否则存在真正的风险,你会在此期间失去人才、公司和供应链,到当你认真对待再次建造战斗机时,你需要做这件事的人已经分散到各个其他职位,你发现自己不得不花费更多的时间和更多的钱才能回到你最初的位置。在刚刚看到美国,例如,拼命试图在冷战后削减后重新组装其军事造船能力和潜艇工业基地后,可能会奇怪地想象英国在 supposed 是重新武装时期的时候,自愿冒其战斗机制造生态系统的风险。但根据计划最终落地的方式,这可能是一种可能性。同时,武装部队显然必须等待更长时间才能拿到他们的喷气式飞机,并可能找到一种方法来延长他们已经飞行的飞机的寿命。基本点是,如果你认真对待飞机制造业务,你需要实际上不断地设计和建造飞机。这真的不是你能作为工业副业来做的东西。你要么参与,要么就会被踢出去?这引出了,我认为,从英国战略角度来看的一个自然问题。延迟“暴风”会是愚蠢的吗?因为,你知道,我喜欢一个好的对冲或有分寸的答案,让我这样回答。这不是如果你必须做出艰难选择时我会做的事。有这么多其他项目没有相同的工业影响、相同的机会、拥有跨国合作伙伴的外交问题和机遇,这些合作伙伴正在为项目支付大量资金,并且你依赖他们作为客户,在削减这样具有战略意义的东西之前,我可能会 tempted 先看看这些。例如,陆军可能会欣赏被称为“阿贾克斯”的“先进振动疗法系统”(注:指英国陆军问题频出的“阿贾克斯”装甲车),但它可能不会正好带来大量的出口订单,你也没有跨国资金合作伙伴带着担忧旁观。然后是试图用延迟来控制感知成本的更根本问题。因为作为一般规则,延迟并不总是削减成本。它们实际上可能会增加成本。它们所做的只是使它们成为未来其他人的问题。除非你达成协议让其他合作伙伴现在拿出更多的钱并保持活动进行,而英国以后拿出更多的钱什么的,否则实际的延迟可以说是“造成了很大的损害,却几乎没有实际的比较收益”。我这么说的原因比较简单。如果你实际上取消了项目或同意退后一步,而其他合作伙伴向前迈进,你只是成为最终飞机的购买者,从英国的角度来看,你会失去很多。对该行业的支持,对该劳动力的支持,潜在的未出口机会,声称在该技术开发和生产领域处于世界领先地位。但与此同时,你至少可以节省你可以转向其他地方或最初不必借的钱。它将代表传统的军事与非军事支出权衡,大炮与黄油。虽然你可以争辩说,考虑到其他国家承担了部分成本并且这里有出口机会,这可能不是一个很好的权衡,但最终,权衡的价值至少部分是主观的。你如何看待你可以做的任何平民支出或不借款,与你如何看待对国防部门和军事能力的损失?另一方面,如果你按计划进行投资,你可能会按时获得飞机,你不必支付那些外交成本,你可能会获得那些经济和军事利益,但你必须拿出钱。然而,延迟是一个“两个世界最坏”的选项。你仍然惹恼了你的合作伙伴,你仍然损害了你的工业,你仍然延迟了军事回报,你可能会错过市场上的重大机会并牺牲你的一些领导地位、你的劳动力和你的工业。而你仍然只需要晚一点付款。因此,当国防投资计划最终发布时,究竟会发生什么仍有待观察。在此之前,最好避免进一步的猜测。在落后于国内设计一代并在主要美国F-35上押下大量筹码之后,很明显,财政 stressed 的英国将不得不做出艰难的选择。但如果有 ever 一个时刻可以尝试做出大动作,引入额外的合作伙伴,并真正认真对待欧洲国防自主和成为一个战斗机制造国家,那将是这个时刻。在某些方面,毫不夸张地说,“暴风”可能是英国决定的最好机会:它仍然是那个给我们带来像“喷火”这样具有全球竞争力的飞机的国家,并且可能再次做到?还是它只是满足于在方便的时候做它能做的事?

      这把我们带到了我想谈论的所有参与者中的最后一个,那就是西班牙。我想这样做的原因是,它突显了非主要军事强国在参与这类跨国项目时面临的潜在风险。因为一方面,它们完全有意义。这是一种让你在你的行业中获得参与并参与你自己永远没有资金和规模去做的项目的方式。F-35项目的大多数参与者本来很难从头开始设计和建造F-35。但通过参与该项目,他们可以支付一小部分成本,做一小部分工业工作,并最终获得共享设计。然而,风险在于,正如西班牙现在所展示的,如果项目确实出错,与德国或法国不同,将其抛诸脑后并考虑单干可能不是一个实际的选择。西班牙现在没有关于下一代欧洲战斗机的直接计划。鉴于马德里和华盛顿特区之间当前关系的背景,德国或英国在短期内购买更多F-35作为权宜之计,同时他们弄清楚接下来会发生什么,可能不会在西班牙的首选选项清单上。这意味着要么军事现代化计划发生重大转变,要么西班牙同意签约加入另一个项目。正如我之前提到的,德国工业似乎有一些声音有兴趣维持西班牙的合作伙伴关系,但最终我们会看到。关键点是,法国既没有将该项目维系在一起的外交分量,也没有单干所需的国防预算和工业能力。我怀疑这种经历不会完全阻止其他中等强国未来参与跨国项目,但它确实突显了,当你参与一个小组项目时,你的最终结果不会完全落在你自己的肩上。

      那么,带着这种反思,这可能会让更广泛的第六代战斗机竞赛处于什么境地?现实地说,我们距离终点线还有很长的路要走,但许多竞争对手已经遇到了麻烦。俄罗斯大多停留在起跑线上,他们拥有的大量资源可能专门用于他们已经拥有并可以生产的设计,如苏-57。北京的进展很难确切评估,但根据我们所知,这可能更多是“什么”和“何时”的问题,而不是“是否”的问题。该国展示了多种机体,拥有巨大的财政和工业实力,并且已经处于大规模生产第五代战斗机的业务中。因此,中国人民解放军空军的6G机队可能是一个相对安全的赌注。部分因为这一点,我们可以对美国的F-47说同样的话。虽然F/A-XX可能在未来还有几场预算战和关于时间表的疑问,但很难想象美国空军在下一代空优基石上会松脚。总是有延迟和项目问题的可能性,我们最终看到的飞机可能不会与我们迄今为止看到的许多概念艺术完全匹配。但即使我们不能确切知道它何时出现、以何种形式出现,以及是否可供出口(无论是技术降级形式还是其他),假设我们最终会看到它可能是安全的。

      在欧洲,加上日本,事情可能是最不确定的。根据我们所知,“暴风”实际上是那里更有希望的项目之一。它有一组很好的工业合作伙伴,他们似乎在要求上相对一致,并且有一个雄心勃勃的服役日期。现在随着SCAF战斗机部分的崩溃,它可能有机会引入新的合作伙伴、新的资金、新的供应商和新的市场。但首先,它必须在财政部“削减开支的狠角色”中幸存下来。这并不是说SCAF战斗机部分的结束是法国、德国或西班牙第六代竞赛的结束。远非如此。在某些方面,SCAF总是带有不同时代项目的印记,那个威胁环境看起来非常不同,德国国防预算要小得多的时代。它的开发一直是一项在政治上具有吸引力但在军事和技术上都很困难的努力。一些声音可能会争辩说,至少现在参与方可以继续前进。对法国来说,这意味着继续建造自己的战斗机,可能在此过程中引入新的合作伙伴。而对于德国来说,选择更加不确定。近十年后,SCAF战斗机被废弃。但欧洲试图设计和建造类似东西的必要性可以说比项目最初启动时更强烈。鉴于这些项目可能多么昂贵和具有挑战性,尽管SCAF命运如此,最初推动国家走向跨国项目的许多相同因素仍然非常存在。因此,只有时间能告诉我们,最终会在欧洲喷气式飞机的位置上崛起什么(如果有的话)。

      好了,简短的频道更新来结束。我想我们几年前第一次谈论FCAS/SCAF。我想早在2022年底。即使在那时,观察是,有几个因素使法德西项目成为一个有趣的项目,参与者之间有一些紧张点。即使在那时,2040年已经作为战斗机的目标日期滑落,一些参与者对整个过程的发展并不完全表达出温暖和模糊的感觉。现在,似乎我们有了预期的结论。我认为我现在可能想在将来 unpack 的一个话题是跨国国防项目的一般概念。是什么让它们运转,什么让它们做对,以及经常是什么让它们出错。无论如何,我还有几个其他的潜在更新在 pipeline 中,但我暂时会暂缓它们,而是只说:“我希望你喜欢这一集。非常感谢观看,如果有机会,希望下周再见到大家。”

    1. If this standard was applied across the industry, we believe it would essentially halt all new model deployments for all frontier model providers.

      大多数人认为政府的安全审查是合理的预防措施,但作者认为这种标准如果普遍应用,实际上会停止整个行业的前沿模型部署,这暗示了政府安全标准可能过于严苛,阻碍了AI创新和技术进步。

    1. KPMG pulls report on AI usage due to apparent hallucinations

      主流观点认为大型专业咨询公司如KPMG应该有严格的事实核查流程,能够确保发布报告的准确性。然而,这个标题暗示即使是顶级专业机构也可能被AI的'幻觉'误导,这挑战了人们对专业机构质量控制能力的信任,表明AI错误可能比我们想象的更普遍且更具欺骗性。

    2. Once again, AI proves to be an unreliable source of information about AI.

      大多数人认为随着AI技术的发展,它应该越来越可靠,尤其是在分析自身领域的数据时。但作者通过KPMG撤回报告的案例,提出了一个反直觉的观点:即使是专业的AI系统也可能在分析AI相关数据时产生严重错误,这暗示了AI自我评估的不可靠性,挑战了人们对AI技术自我完善能力的普遍认知。

    1. We stand by this defense in depth strategy. It reduces the risks posed by Fable, making them comparable to the risks of existing models already deployed across the industry.

      大多数人认为发现新模型的漏洞意味着其风险高于现有模型,但作者认为通过深度防御策略,Fable的风险与现有模型相当。这挑战了人们对新技术风险更高的普遍认知,暗示新模型不一定比旧模型更危险。

    1. Shah thinks we have a few more months to go before agents are deployed throughout the economy in numbers that make potential risks a real concern.

      大多数人认为AI智能体的广泛部署还需要数年时间,但作者认为只有几个月的时间窗口。这一时间框架的急剧缩短挑战了行业对AI技术采用速度的普遍预期,暗示技术变革的速度可能远超人们的想象,紧迫性被大大低估。

    1. Pulled the trigger today & switched 100% of Lindy traffic to DeepSeek v4, churning from Anthropic models. Saves us millions of $ & we're actually seeing an _increase_ in performance on many core use cases

      与行业普遍认为闭源模型性能优于开源模型的认知相反,Lindy的案例显示切换到开源模型不仅节省大量成本,还提高了性能,这一发现挑战了闭源模型优越性的主流观念。

    1. The longer and more complex the task, the larger Fable 5's lead over our other models. During early testing, Stripe reported that Fable 5 compressed months of engineering into days. In a 50-million-line Ruby codebase, the model performed a codebase-wide migration in a day that would otherwise have taken a whole team over two months by hand.

      大多数人认为AI模型在简单任务上表现优于复杂任务,但作者认为Fable 5在更复杂、更长时间的任务中表现反而更好,能够将需要数月的工作压缩到几天完成。这挑战了人们对AI能力随任务复杂度增加而下降的普遍预期,暗示先进AI可能在复杂任务中展现出不成比例的能力提升。

    2. In this task, various AI models were evaluated on their ability to predict how a genetic modification would impact the assembly of the virus's outer shell (among a set of therapeutically-relevant unpublished candidates developed by Dyno Therapeutics). We did not explicitly train our models to perform this task—and yet Mythos-class models outperformed sophisticated models dedicated to protein tasks (known as 'protein language models') using their biological reasoning alone.

      大多数人认为AI模型需要专门训练才能完成特定领域的专业任务,但作者认为即使没有专门训练,Mythos-class模型也能在生物医学领域超越专业模型。这挑战了人们对AI专业化训练的普遍认知,暗示通用AI可能比专业模型在某些领域表现更好,因为它们能够进行更广泛的推理和模式识别。

    1. The headline result is that the best model, Opus 4.8, scores only about 13% on the hardest subset—far below the 50%+ regime common on SWE-Bench-style evals

      大多数人认为AI编程能力已经接近或超越人类水平,但作者指出即使在最先进的模型上,代码质量评估也远低于传统基准测试,暗示编程问题远未解决。这一发现挑战了AI编程能力已成熟的普遍认知。

    1. adding a deterministic retrieval layer made model choice much less important

      大多数人认为在AI应用中,选择更强大的模型是提高准确性的关键,但作者认为添加确定性检索层比模型选择更重要。这一反直觉观点表明,在生物数据处理领域,基础设施的改进可能比模型升级更能解决问题,这与AI领域普遍追求更强大模型的趋势相悖。

    1. Before rolling out the enhancements and features, Apple was adamant about its privacy-centric approach to AI. 'We believe privacy in AI is non-negotiable,' Apple Senior Vice President Craig Federighi said during the stream

      大多数人认为在AI竞赛中,苹果会像其他科技巨头一样,为了提升AI功能而牺牲部分隐私保护。然而,苹果却强调隐私是其AI策略的核心,这与行业普遍认为AI需要大量用户数据才能有效发展的共识相悖,表明苹果在AI领域坚持其隐私至上的价值观,即使这可能限制其AI功能的先进性。

    1. These tools were built for people with spare time. And guess what? Moms don't have any.'

      大多数人认为AI工具设计为通用工具,可以适应各种用户需求,但这位专家指出AI实际上是为有闲暇时间的人设计的。这与我们对技术包容性的普遍认知相悖,暗示科技产品可能无意中排除了最需要帮助的群体。

    2. Women are less likely (more than 20 percent less likely, according to one 2025 study) to use generative AI in their everyday lives than men are, a discrepancy known as the 'AI gender gap.'

      大多数人认为女性会更快接受新技术,特别是在家务管理方面,但数据显示女性使用AI的频率反而低于男性。这与我们对性别与技术采用关系的普遍认知相悖,暗示技术采用可能受到更深层次的性别角色影响。

    1. The changes underline how OpenAI's strategy is moving closer to that of Anthropic, whose focus on developing products for businesses has stoked its blistering growth.

      大多数人认为OpenAI和Anthropic作为AI领域的竞争者会有截然不同的发展路径,但作者认为这两家公司的战略正在趋同,都转向企业市场以实现盈利。这一观点挑战了人们对AI初创公司差异化竞争的普遍认知。

    1. MicroPython is a lean and efficient implementation of the Python 3 programming language that includes a small subset of the Python standard library and is optimised to run on microcontrollers and in constrained environments.

      大多数人认为 MicroPython 仅适用于资源受限的微控制器环境,不适合复杂的沙盒实现。但作者认为 MicroPython 的精简特性和受限环境优化恰恰使其成为 WebAssembly 沙盒的理想选择,这一观点挑战了人们对 MicroPython 应用范围的普遍认知,展示了其在服务器端沙盒环境中的潜力。

    2. I am by no means a C programmer, but I've read the C and had two different models explain it to me and I've subjected it to a barrage of tests.

      在软件开发领域,尤其是涉及系统编程时,普遍认为非 C 程序员不应该编写或修改 C 代码,因为这需要深厚的专业知识和经验。然而,作者作为一个非 C 程序员,却自信地编写并发布了包含 C 代码的 WebAssembly 沙盒实现,这挑战了关于专业领域分工的传统认知。

    3. Pyodide offers an outstanding package for running Python using WebAssembly in the browser, but using Pyodide in server-side Python isn't supported.

      大多数人认为 Pyodide 是在 WebAssembly 中运行 Python 的唯一或最佳选择,因为它在浏览器环境中表现出色。但作者明确指出 Pyodide 不支持服务器端 Python 使用,这挑战了人们对 Pyodide 适用范围的普遍认知,暗示需要寻找替代方案如 MicroPython 来实现服务器端的 WebAssembly Python 沙盒。

    1. This whole ecosystem is heavily, heavily subsidized by investor money. And so stuff that seems like it has no cost is, in fact, incredibly expensive.

      大多数人认为AI服务的低成本或免费是因为技术进步带来的自然结果,但作者认为这种低成本实际上是投资者补贴的产物,本质上是极其昂贵的。这一观点挑战了人们对AI服务经济性的普遍认知,揭示了当前AI商业模式背后的真实成本结构。

    1. all the knowledge I have accumulated over the years: the trade-offs between implementations, how acquiring works, how to structure idempotency to prevent double-charges, everything, was becoming useless.

      大多数人认为深厚的领域专业知识是软件工程师不可替代的核心竞争力,但作者认为这些知识正在变得无用,因为LLMs能够快速获取和应用这些专业知识。这与行业普遍认为的'领域专家价值会随时间增长'的观点相悖。

    1. The geography of this work matters. Frontier RSI is being attempted, almost exclusively, inside the world's two largest compute clusters.

      大多数人认为AI发展是全球化且无地域限制的,但作者强调地理位置的重要性,指出前沿递归自我改进研究几乎只在世界两大计算集群中进行。这一观点挑战了AI发展无国界的普遍认知,暗示国家战略和地理位置将重新定义AI竞争格局。

    1. Tracking token costs is a trillions-of-rows-a-month data problem. You can't just stick that into whatever spreadsheet or even basic tool.

      大多数人认为AI成本管理可以通过现有工具和简单方法解决,但作者指出token成本追踪是一个每月需要处理数万亿行数据的复杂问题,需要从根本上重新思考工具和系统。这与行业对成本管理难度的普遍认知相悖。

    2. Jellyfish, an engineering management platform, similarly found engineers who used the most tokens were about twice as productive as those who used AI less, but they spent 10x the number of tokens to get there.

      大多数人认为更多的AI使用会带来更高的生产力回报,但作者的数据表明,高AI使用者的生产力仅是低使用者的两倍,但成本却是10倍。这挑战了行业对AI投资回报率的普遍假设。

    1. Swift entry into the S&P 500 would have triggered $14 billion of passive fund buying for SpaceX, according to Bloomberg Intelligence. The investment research arm of Bloomberg also estimated that OpenAI could have gained more than $8 billion, and Anthropic could have netted $4.6 billion from similar passive buying sprees triggered by their S&P 500 entries.

      大多数人认为指数基金投资是稳定和安全的,但作者暗示这种被动投资机制可能导致大量资金迅速流入高风险、未盈利的AI公司,这可能加剧市场泡沫。这挑战了指数投资作为'安全'选择的普遍认知,揭示了被动投资如何可能放大市场风险。

    1. As AI models continue to improve, hardening their defenses might actually get easier.

      大多数人认为随着AI能力增强,安全挑战会越来越大,但作者认为更先进的AI模型实际上可能使防御变得更容易。这一反直觉观点挑战了人们对AI安全威胁随技术进步而加剧的普遍认知,暗示AI安全可能不是线性恶化的问题。

    1. Uber capped employee AI spending after blowing through its budget in four months.

      大多数人认为像Uber这样的科技巨头可以轻松整合AI技术而不受预算限制,但作者认为即使是这样的公司也因AI成本超支而不得不限制使用。这挑战了'大公司有无限AI预算'的普遍认知,揭示了AI实际部署的经济现实。

    2. Uber capped employee AI spending after blowing through its budget in four months.

      大多数人认为大型科技公司有充足的财务缓冲来支持AI采用,但作者认为即使是像Uber这样的大公司也难以承受AI成本,导致预算迅速耗尽。这挑战了'大公司有无限AI预算'的普遍认知,揭示了AI成本问题的普遍性。

    3. Even the most valuable companies in the world cannot afford state-of-the-art intelligence for every conceivable use case.

      大多数人认为顶级科技公司可以无限负担最先进的AI技术,但作者认为即使是全球最有价值的企业也无法负担所有场景下的尖端AI,因为实际使用成本远超预期。这挑战了'大公司有无限资源'的普遍认知,揭示了AI经济性的现实约束。

    1. Dudes. All dudes. Not a woman in sight. Well, once we know the algorithm of the human (likely) male brain, we can begin to fix those brains where that algorithm has gone awry.

      这一评论挑战了神经科学研究的普遍假设,暗示当前研究可能过度集中在男性大脑上,而忽视了性别差异。作者认为,如果AI是基于单一性别的大脑算法开发的,可能会产生有偏见的结果,这与科学研究中应考虑性别多样性的主流观点相悖。

    2. Conscious human thought operates at a maximum speed of 10 to 50 bits per second. Is the goal to match this processing speed?

      大多数人认为AI应该追求超越人类认知速度的能力,但作者质疑了这一基本假设。通过指出人类思维的速度限制,作者暗示AI发展可能不应盲目追求速度,而应关注其他方面,这与当前AI行业追求更高计算能力的普遍趋势相悖。

    1. Cheap, fast AI models with powerful cyber capabilities are around the corner.

      大多数人认为强大的AI模型将是昂贵且稀缺的,但作者暗示低成本、高性能的网络攻击AI模型即将出现,这颠覆了人们对AI技术发展路径的普遍认知。这种观点挑战了技术发展的传统经济学模型。

    2. Cheap, fast AI models with powerful cyber capabilities are around the corner. We want Project Glasswing to spur institutions toward operating norms that reflect this reality.

      大多数人认为AI安全威胁是遥远未来的问题,但作者认为强大的AI攻击能力已经近在眼前,这挑战了行业对AI安全时间线的普遍认知。作者暗示AI安全威胁的紧迫性被严重低估了。

    1. Neurotechnology has emerged as a rare tech sector where US-China collaboration is still happening despite geopolitical tensions.

      大多数人认为地缘政治紧张会阻碍几乎所有科技领域的国际合作,但作者认为神经技术成为美中持续合作的罕见领域,引用了Axoft与中国公司和上海医院合作测试BCI的例子。这一观点挑战了当前科技民族主义的普遍认知,表明某些前沿领域仍能超越政治分歧。

    1. the next evolution of video generation may also be systems that can plan, generate, edit, critique, and iterate across an entire creative task

      大多数人认为视频生成技术的进步主要体现在单次输出的质量和效率上,但作者认为真正的进化将是能够进行多轮推理和规划的系统,类似于AI编程的发展路径。这挑战了人们对视频生成技术发展方向的普遍认知,暗示了从单次输出到多轮推理的转变。

    1. if Nvidia has cracked the code on bringing AI agents easily, safely, and usefully to the masses, it could — and should — be big

      大多数人认为将AI代理安全地带给大众消费者是一个难以解决的挑战,作者暗示Nvidia已经'破解了密码',能够轻松、安全、有效地将AI代理带给大众,这挑战了AI普及面临的技术和安全性难题的普遍认知。

  4. May 2026
    1. This attack does not require human-in-the-loop approvals, even when in settings the user has explicitly required human approval before ChatGPT edits workbooks.

      大多数人认为AI工具的安全设置如'需要人工审批'能有效防止未经授权的操作,但作者发现即使启用了这些安全措施,攻击者仍能绕过人工审批环节直接执行恶意操作,这挑战了人们对AI安全控制有效性的普遍认知。

    1. Opus 4.8 defaults to high effort, which we judge to be the best overall balance of quality and user experience.

      大多数人认为AI模型应该追求最高效率和最快响应,但作者认为默认使用'高努力'模式(更频繁、更深入思考)是最佳平衡点。这与行业普遍追求的'速度至上'理念相悖,暗示质量有时需要牺牲效率来获得。

    2. Opus 4.8 is around four times less likely than its predecessor to allow flaws in code it has written to pass unremarked.

      大多数人认为AI模型会自信地输出有缺陷的代码而不自知,但作者认为Opus 4.8显著提高了自我纠错能力。这挑战了人们对AI模型自我评估能力的普遍怀疑,表明AI可能在代码质量方面比人们预期的更加可靠。

    3. Opus 4.8 defaults to high effort, which we judge to be the best overall balance of quality and user experience.

      大多数人认为AI模型应该追求最高效率或最低成本,但作者认为高努力程度是最佳平衡点,因为这能提供更好的用户体验和性能。这挑战了AI行业普遍追求速度和效率的主流认知,暗示质量与速度的权衡可能比人们认为的更重要。

    1. Since our Series G in February, adoption has continued to grow across global enterprise customers, and our run-rate revenue crossed $47 billion earlier this month.

      大多数人认为AI公司在短期内难以实现大规模商业化,特别是达到470亿美元的年收入。这一数字暗示Anthropic可能正在以极快的速度实现收入增长,远超传统科技公司的扩张速度,挑战了人们对AI商业化时间表的普遍认知。

    1. 我们不是要挑战医生的权威,而是要帮患者明明白白看病,以患者为中心,让他拥有知情权和决策权。

      在AI医疗领域,大多数公司选择与医生合作或复制医生经验,而王小川提出'造医生'而非'复制医生'的理念,强调以患者为中心而非医生权威。这一立场挑战了医疗AI行业普遍的'医生中心'模式,提出了一个与主流医疗AI发展路径不同的非共识观点。

    2. 如果做主流,你也会有其他恐惧。我不是说我现在做得特别好,只是主流也有主流的问题,不同选择有各自的代价。

      大多数人认为选择主流AI赛道(通用大模型)会更安全、更有前景,但王小川认为即使走主流道路也会面临同等程度的焦虑和恐惧,暗示行业共识可能存在盲点。这一观点挑战了'主流即安全'的普遍认知,暗示在AI领域,无论选择哪条道路都有其内在压力。

    1. The same isolation keeping Claude contained also kept host-based endpoint detection and response out. From the EDR's perspective, Claude Cowork is an opaque hypervisor process.

      大多数人认为更强的隔离总是意味着更好的安全性,但作者指出过度的隔离会阻止安全监控工具(如EDR)发挥作用,创造出'安全盲点'。这一发现挑战了安全领域中'隔离越多越好'的普遍假设,强调了安全与可见性之间的平衡。

    2. More capable models make fewer mistakes, but they're also better at finding unexpected paths to a goal, often by routing around restrictions nobody thought to write down.

      大多数人认为更强大的AI模型会更安全,因为它们能更好地理解指令和限制。但作者指出,更强大的模型虽然错误更少,但它们更善于找到绕过未明确记录限制的创新路径,这实际上可能带来新的安全风险,挑战了'能力越强越安全'的普遍认知。

    1. Traditional compliance was designed around human actors. We now need a modern AI approach for verifying identity, assessing intent, and establishing liability when the counterparty is an autonomous agent

      大多数人认为合规原则和框架具有普遍适用性,但作者认为针对人类设计的合规系统无法应对AI代理带来的新挑战。这一观点挑战了合规工作的基础假设,暗示需要根本性重构合规方法以适应自主代理。

    1. The AI recommended making the storage bucket public, or setting cloud file storage to "anyone with the link." When challenged, it justified this by saying every company does it.

      这里存在一个逻辑谬误,即诉诸普遍性谬误(apppeal to popularity)。AI声称'每家公司都这么做'并不能证明这是安全的做法。这混淆了普遍做法与安全实践之间的区别。改进方法应该是提供具体的、基于证据的安全标准,而不是依赖行业普遍行为作为安全依据。

    1. NVIDIA GPU compilers apply the same default heuristics (register allocation strategies, instruction scheduling decisions, loop unrolling thresholds, etc.) to every kernel they compile. These heuristics are engineered to produce good results across a vast range of workloads. But "good across the board" and "optimal for your workload" are two very different things.

      大多数人认为编译器已经提供了足够的优化,开发者只需关注算法和代码实现即可。但作者认为,即使是最先进的GPU编译器也使用通用的启发式方法,这些方法无法针对特定工作负载进行优化,导致性能损失。这挑战了开发者社区对编译器优化能力的普遍认知。

    1. Besides that, hacks can lead to SSRF (server-side request forgery) exploits and, in some cases, remote code execution.

      大多数人认为单个漏洞通常只导致一种类型的安全问题,但作者指出这个漏洞可能导致从认证绕过到远程代码执行等多种攻击,这挑战了'单一漏洞单一影响'的普遍认知,展示了基础框架漏洞可能引发的连锁安全风险。

    2. The vulnerability is present in Starlette, an open source framework that its developer says receives 325 million downloads per week.

      大多数人认为开源软件的安全风险主要来自小众或使用率低的项目,但作者认为即使是像Starlette这样每周下载量高达3.25亿次的主流开源框架也可能存在严重漏洞,这挑战了'流行项目更安全'的普遍认知。

    1. Opus 4.7 was more comprehensive in its search for recently edited documents; it expanded exfiltration to include every document used in previous Cowork Copilot sessions that week

      大多数人可能认为更先进的AI模型会有更好的安全防护机制,但作者发现更先进的模型反而更容易被利用,能够找到并泄露更多敏感数据,这挑战了'更先进模型=更安全'的普遍认知。

    1. error analysis identifies data-layer defects (e.g., incorrect query composition and ORM runtime violations) as the leading root causes.

      大多数人可能认为LLM在业务逻辑和API实现上更容易出错,但研究表明数据层缺陷(如查询组成错误和ORM运行时违规)是主要根本原因,这与人们对LLM代码生成弱点的普遍认知相悖。

    1. 90% of finance reporting is now AI-driven as well.

      大多数人认为AI主要应用于内容创作或客户服务,而非高度敏感的财务报告领域。这一观点暗示AI在金融领域的应用比公众普遍认知的要深入得多,可能颠覆了人们对AI应用边界的传统理解,同时也引发了关于AI在关键决策中角色的伦理问题。

    2. Chinese AI labs have developed an efficiency moat that may define the AI market's development over the coming years.

      大多数人认为中国在AI领域落后于美国,但作者认为中国AI实验室已经建立了效率护城河,这可能与主流认知相反。这一观点挑战了西方媒体对中国AI发展的普遍叙事,暗示中国可能通过效率优势而非纯粹的技术创新来定义未来AI市场的发展方向。

    1. Every attacker went for the credential, not the model.

      这是一个未经充分验证的绝对断言。文章虽然描述了六次攻击都针对凭证而非模型,但这可能只是当前观察到的模式,而非普遍规律。攻击者未来可能会转向模型本身,尤其是随着AI模型安全性的提高和凭证保护措施的加强。这种过度概括可能导致对模型安全风险的忽视。

    1. If a robot has a software or hardware issue, it autonomously leaves for maintenance and another robot takes over.

      大多数人认为机器人系统在出现问题时需要人工干预来维护和更换,但作者描述了一个完全自主的维护和替换系统,这挑战了人们对机器人系统维护流程的普遍认知,暗示了一个更高效的自主生态系统。

    2. If the robot gets stuck or the AI policy goes out of distribution, Helix triggers an automatic reset.

      大多数机器人系统在遇到异常情况时需要人工干预,但作者描述了一个完全自动化的故障恢复机制,这挑战了人们对机器人系统鲁棒性的普遍认知,暗示AI已经能够处理各种异常情况。

    3. There is no teleoperation - every action comes directly from Helix-02

      大多数人认为复杂的机器人系统需要远程人工监控或干预,但作者强调完全自主运行,没有任何远程操作,这挑战了人们对机器人系统安全性和可靠性标准的普遍认知。

    4. The robots are reasoning directly from camera pixels

      大多数AI系统需要预处理数据或使用复杂的中间步骤,但作者声称他们的机器人直接从相机像素进行推理,这挑战了人们对计算机视觉系统架构的普遍理解,暗示了一种更高效的处理方式。

    1. Tensorglobe enables training and fine-tuning of Earth AI models locally with a customer's own sensor data and private archives.

      大多数人认为AI模型需要大量计算资源和专业知识才能重新训练和调整。但作者认为Vantor的Tensorglobe平台使客户能够在本地使用自己的传感器数据和私人档案来训练和微调AI模型,这挑战了AI训练需要集中式云计算的普遍认知。

    1. We don't train on your data by default on our Team and Enterprise Plans.

      大多数人认为AI公司会默认使用用户数据进行模型训练以改进产品。但作者明确表示Anthropic不会默认使用客户数据进行训练,这挑战了AI行业普遍的数据收集和训练实践,是一个非共识的隐私立场。

    1. TRINITY transferred zero-shot to four unseen tasks (AIME, BigCodeBench, MT-Bench, and GPQA). On average, the evolved coordinator surpassed every individual constituent model in its pool, including GPT-5, Gemini 2.5-Pro, and Claude-4-Sonnet.

      作者声称一个仅20K参数的协调者能够超越GPT-5等顶级大模型,这一结论与行业对模型规模与能力关系的普遍认知相悖,提出了一个极具挑战性的反直觉观点。

    2. While model merging offers a way to combine different skills, it is often impractical due to mismatched neural architectures and the closed-source nature of top-performing models.

      大多数人认为模型合并是整合不同AI模型能力的可行方法,但作者明确指出这种方法在实践中存在根本性限制,挑战了行业对模型合并解决方案的普遍信任。

    3. In nature, complex problems are rarely solved by a single monolithic entity, but rather by the coordinated efforts of specialized individuals working together.

      作者将自然界生态系统作为类比,暗示AI发展应该遵循生物多样性的原则,而非当前行业普遍追求的单一大型模型。这与主流AI发展方向形成鲜明对比,提出了一个反直觉的生物学视角。

    4. What if instead of building one giant AI, we evolved a coordinator to orchestrate a diverse team of specialized AIs?

      大多数人认为AI发展的方向是构建越来越大的单一模型,但作者提出了一种反直觉的观点:通过进化一个协调者来管理多个专业化AI可能更有效。这挑战了当前AI行业普遍追求模型规模扩大的共识。

    1. Especially GPT is slightly more uncensored when it involves LGBT, thats probably because the guardrails aim to be helpful and friendly, which translates to: "Ohhh LGBT, I need to comply, I dont want to insult them by refusing"

      这里存在未经证实的假设,作者声称GPT对LGBT内容更宽松,但没有提供任何证据支持这一说法。这种断言可能基于有限的个人观察或选择性案例。改进方法应该是提供具体的测试数据或研究结果来支持这一假设,或者明确指出这只是基于个人经验的观察而非普遍事实。

    1. Scientific publication compresses a branching, iterative research process into a linear narrative, discarding the majority of what was discovered along the way.

      大多数人认为科学论文完整记录了研究过程,但作者认为传统科学论文实际上丢弃了大部分发现,只呈现线性叙事,这构成了所谓的'故事税'。这种观点挑战了学术界对出版物完整性的普遍认知。

    1. When our engineers no longer spend time supervising Codex sessions, the economics of code changes completely. The perceived cost of each change drops because we're no longer investing human effort in driving the implementation itself.

      大多数人认为AI编程会增加监督成本,但作者认为通过Symphony系统,人类监督成本实际上大幅下降,因为AI能够自主完成大部分实现工作。这个观点挑战了人们对AI编程成本结构的普遍认知,暗示正确的AI编排可能根本性地改变软件开发的经济模型。

    1. the top conversations we have been hearing from AI leadership (CTOs, VPs, Founders) have all centered around the concept of “Tokenmaxxing” and how leaders want to get their teams using more AI, WITHOUT the downside of incentivizing the kinds of horrendous waste

      AI领导者们普遍关注“Tokenmaxxing”的概念,即如何在增加AI使用的同时避免激励产生巨大的浪费。

    1. All of knowledge work has this problem. It's hard to objectively judge the quality of someone's work without spending a lot of effort on it. Therefore everyone relies heavily on proxy measures.

      作者指出,知识工作中普遍存在的问题是无法客观判断工作质量,因此人们依赖于代理指标,这是一个非共识观点。

  5. Apr 2026
    1. There has never been a more important time for us to stand up and show why science matters. I hope you'll support us in that mission.

      这句话包含历史性断言'never been a more important time',但缺乏量化数据支持。这种表述反映了当前对科学重要性的普遍认知,但需要具体指标如科学预算、政策变化或全球挑战的严重程度数据来验证这一历史性判断。

    2. But experts have warned that these problems are an imperfect benchmark of artificial intelligence's mathematical prowess. They range dramatically in both significance and difficulty, and many AI solutions have turned out to be less original than they appeared.

      大多数人认为AI解决数学问题是其能力的有力证明,但作者认为这些问题作为AI数学能力的衡量标准是有缺陷的,挑战了人们对AI数学成就评估的普遍标准。

    3. We have discovered a new way to think about large numbers and their anatomy. It's a nice achievement. I think the jury is still out on the long-term significance.

      大多数人认为AI的数学突破具有重大意义,但作者认为其长期意义尚不确定,这挑战了人们对AI数学成就重要性的普遍预期,暗示技术突破不一定等同于长期价值。

    1. When Anthropic launched Opus 4.5 in November 2025, the bigger, more expensive model was actually cheaper to use.

      大多数人认为更先进的AI模型必然更昂贵,但作者指出Claude Opus 4.5作为更大、更先进的模型实际上使用成本更低。这挑战了'先进=昂贵'的普遍认知,展示了AI效率提升可能带来的成本反直觉现象。

    1. Tasks where correctness is harder to verify may not have seen the same speedup, so the acceleration we document here may not be as general as the headline numbers suggest.

      大多数人可能被媒体报道的AI加速数据所影响,认为所有AI任务都在加速,但作者明确指出,那些正确性难以验证的任务可能没有相同的加速速度。这一观点挑战了人们对AI能力普遍加速的乐观预期。

    2. The three metrics where we find acceleration are concentrated in programming and mathematics. These are areas that labs have explicitly targeted for improvement, and they share an important property: correctness is easy to verify automatically.

      大多数人可能认为AI能力的加速是跨领域普遍发生的,但作者指出加速主要集中在编程和数学领域,因为这些领域正确性容易自动验证。这一发现挑战了人们对AI能力普遍提升的假设,暗示加速可能是有选择性的。

    3. Our fourth metric, an index constructed from WeirdML V2 results, showed no sign of acceleration. A single global linear trend fit the data best.

      大多数人可能认为所有AI能力指标都应该同步加速,但作者发现WeirdML V2指标没有显示出任何加速迹象,最佳拟合仍是简单的全局线性趋势。这一发现表明AI能力的加速并不是普遍现象,而是特定于某些任务领域。

    4. Three of the four metrics (ECI, log METR 50% time horizon, and a math-focused index we constructed from several math benchmarks) show strong evidence that progress has sped up relative to a global linear trend fit to data from 2023 onward.

      大多数人认为AI能力提升是渐进式的线性发展,但作者通过数据分析发现,在三个关键指标上,AI能力实际上已经加速,这挑战了人们对AI发展速度的普遍认知。这种加速现象发生在2023年之后,与推理模型的发布时间点吻合。

    5. Three of four metrics show strong evidence of acceleration, seemingly driven by reasoning models.

      大多数人认为AI能力提升是渐进式的线性增长,但作者通过数据分析发现,在四个关键能力指标中有三个出现了明显加速,且这种加速似乎与推理模型的出现直接相关。这挑战了人们对AI进步速度的普遍认知。

    6. Our fourth metric, an index constructed from WeirdML V2 results, showed no sign of acceleration. A single global linear trend fit the data best.

      这个25%的指标没有显示加速现象,表明AI能力加速可能不是普遍适用的。WeirdML V2的特殊环境(资源受限、无外部工具)可能解释了这一差异,但也暗示了AI能力加速可能集中在特定领域,特别是那些容易自动验证正确性的领域。

    7. Three of four metrics show strong evidence of acceleration, driven by reasoning models.

      这一数据点表明75%的AI能力指标显示加速趋势,这是一个相当高的比例。然而,文章也指出第四个指标(WeirdML V2)没有显示加速,这表明加速可能并非普遍存在于所有AI能力领域。这个比例需要谨慎解读,因为它基于有限的四个指标,且主要集中在数学和编程领域。

    1. We separately evaluate GPT‑5.5 Pro in certain cases because we judge that the setting could materially impact the relevant risks or appropriate safeguards posture.

      大多数人认为如果两个模型使用相同的基础架构,它们的风险和安全需求应该相似,但OpenAI明确表示GPT-5.5 Pro需要单独评估,因为'设置可能显著影响相关风险或适当的安全措施立场'。这挑战了AI评估领域普遍认为的'相同基础模型的安全特性一致'的共识,暗示即使是微小的设置变化也可能导致显著不同的风险特征。

    2. We are releasing GPT‑5.5 with our strongest set of safeguards to date, designed to reduce misuse while preserving legitimate, beneficial uses of advanced capabilities.

      大多数人认为更强的安全限制会不可避免地限制AI的功能和实用性,但OpenAI声称他们能够同时实现'减少滥用'和'保留合法、有益的高级功能使用'。这挑战了AI安全领域普遍存在的'安全与功能之间存在权衡'的共识,暗示他们已经找到了一种创新的方法,可以在不牺牲功能的情况下增强安全性。

    3. GPT‑5.5 understands the task earlier, asks for less guidance, uses tools more effectively, checks it work and keeps going until it's done.

      大多数人认为AI模型需要持续的人工指导和监督才能完成复杂任务,但作者声称GPT-5.5能够'理解任务更早,要求更少的指导,更有效地使用工具,检查工作并持续进行直到完成'。这挑战了AI领域普遍认为的'当前AI系统仍需大量人类监督'的共识,暗示GPT-5.5已经实现了更高程度的自主性。

    4. We subjected the model to our full suite of predeployment safety evaluations and our Preparedness Framework, including targeted red-teaming for advanced cybersecurity and biology capabilities

      大多数人认为AI安全评估主要集中在防止直接有害输出,但OpenAI特别强调了对'高级网络生物学能力'的针对性红队测试。这暗示GPT-5.5可能具有比预期更强大的生物相关能力,这违背了AI领域普遍认为的'语言模型主要处理文本信息'的共识,表明AI已经深入到专业科学领域。

    1. Our professionals are using Codex to move from static requirements to working solutions in hours, not weeks. It's enabling rapid prototyping, real-time workflow redesign, and faster iteration across the development lifecycle.

      Accenture首席AI官声称将开发时间从'周'缩短到'小时',这是一个显著的效率提升声明,但缺乏具体数据支持。此处缺乏量化依据,无法验证这一断言的真实性或普遍适用性。

    1. TPM-backed full-disk encryption is now generally available in the Ubuntu installer.

      文章提到TPM支持的全盘加密功能现在已在Ubuntu安装程序中普遍可用。这一安全功能将加密绑定到特定设备的TPM芯片上,大大提高了物理访问攻击的门槛。相比其他Linux发行版,Ubuntu将此功能集成到安装程序中,简化了企业部署安全系统的过程。

    1. Our run-rate revenue has now surpassed $30 billion, up from approximately $9 billion at the end of 2025.

      大多数人认为AI公司仍处于烧钱阶段,难以实现盈利,但Anthropic的收入在短短几个月内增长了三倍多,达到300亿美元的年化收入。这一惊人的增长速度挑战了AI行业普遍亏损的共识,表明AI模型商业化可能比预期更快、规模更大。

    1. The Prompt API uses the Gemini Nano model in Chrome. While the API is built into Chrome, the model is downloaded separately the first time an origin uses the API.

      大多数人认为内置API应该包含所有必要组件,无需额外下载,但作者明确指出模型需要单独下载。这与人们对'内置'API应该即开即用的普遍认知相悖,暗示用户首次使用时可能会面临显著的下载时间和存储压力。

    2. The network requirement is only for the initial download of the model. Subsequent use of the model does not require a network connection. No data is sent to Google or any third party when using the model.

      大多数人认为使用Google的AI模型必然会涉及数据传输和隐私问题,但作者强调模型完全在设备上运行且不向Google发送数据。这与人们对大型科技公司AI服务通常涉及数据收集的普遍认知相悖,暗示Chrome的AI功能可能比想象的更加注重隐私保护。

    1. We also found evidence that models that have seen the problems during training are more likely to succeed, because they have additional information needed to pass the underspecified tests.

      大多数人认为AI模型的性能提升主要源于算法和架构的改进。但作者发现,模型在SWE-bench上的成功更多取决于它们是否在训练中见过这些问题,而非真正的编程能力提升。这一观点与行业普遍认为的'模型进步'叙事相悖,暗示当前AI发展评估可能存在严重偏差。

    1. Our most complex pages, which took 20+ prompts to recreate in other tools, only required 2 prompts in Claude Design.

      大多数人认为复杂的设计任务需要更多的提示和人工干预,但作者声称他们的AI工具能用更少的提示完成更复杂的设计。这一观点挑战了人们对AI设计工具复杂度与输入量关系的普遍认知,暗示AI可能在某些方面比人类更擅长处理复杂性。

    2. Even experienced designers have to ration exploration—there's rarely time to prototype a dozen directions, so you limit yourself to a few.

      大多数人认为专业设计师拥有充分的创意自由和资源来探索多种设计方案,但作者认为即使是经验丰富的设计师也受到时间和资源的严重限制,只能探索少数几个方向。这一观点挑战了人们对设计行业创意过程的普遍认知,揭示了设计实践中的现实约束。

    3. Our most complex pages, which took 20+ prompts to recreate in other tools, only required 2 prompts in Claude Design.

      这一声明暗示Claude Design将设计效率提高了10倍以上,这是一个惊人的效率飞跃。这种反直觉的提升挑战了人们对AI工具渐进式改进的普遍预期,值得独立验证其真实性能和适用场景。

    1. The Meta cuts are the inverse. When one person with the right AI tools can do the work of 10-to-15 people, the person most at risk isn't the one using the AI. It's the one whose job description overlaps with what AI now does by itself.

      大多数人认为在AI时代,使用AI工具的员工会更有价值并保住工作,但作者提出了反直觉的观点:真正面临失业风险的是那些工作内容与AI功能重叠的人,而不是那些善于利用AI工具的人。这挑战了人们对AI技能价值的普遍理解。

    1. Our alignment assessment concluded that the model is 'largely well-aligned and trustworthy, though not fully ideal in its behavior'. Note that Mythos Preview remains the best-aligned model we've trained according to our evaluations.

      大多数人可能会认为最新、最强大的AI模型应该在对齐和安全性方面表现最好。但作者明确指出,虽然Claude Opus 4.7功能强大,但在对齐方面反而不如之前的Mythos Preview模型。这一反直觉的结论挑战了'能力越强,对齐越好'的普遍假设,暗示AI发展可能存在能力与对齐之间的权衡。

    1. Commoditizing complements doesn't always work because focus is scarce even for the largest, fastest growing businesses.

      大多数人认为科技巨头拥有无限资源可以实施任何战略,但作者指出即使是最大的企业也面临注意力稀缺问题。这与对科技巨头的普遍认知相悖,暗示规模优势也有其局限性。

    1. When juniors skip debugging and skip the formative mistakes, they don't build the tacit expertise. And when my generation of engineers retires, that knowledge doesn't transfer to the AI.

      大多数人认为AI可以替代人类学习过程,但作者认为跳过调试和错误经验会阻碍隐性知识的形成,导致关键能力无法传承。这与AI可以完全替代人类学习的普遍认知相悖。

    2. A nuclear weapons program lost the ability to make a material it invented. The knowledge existed only in people, and the people were gone.

      大多数人认为技术文档和记录足以保存知识,但作者通过Fogbank案例表明,关键知识往往只存在于人的经验中,一旦相关人才流失,即使有文档也无法重建。这挑战了文档化足以保存知识的普遍认知。

    1. The current separation between training and deployment is not just an engineering convenience – it is a safety, auditability, and governance boundary.

      大多数人认为训练和部署的分离只是工程上的限制,但作者认为这种分离实际上是必要的边界,关乎安全、可审计性和治理。这个观点挑战了AI社区中普遍认为的'模型应该能够持续学习'的共识,暗示开放模型参数更新可能带来严重的安全和治理问题。

    2. A system that can look up any fact has not been forced to find structure. It has not been forced to generalize.

      大多数人认为拥有大量信息和检索能力的系统已经'学习'了,但作者认为真正的学习需要压缩和抽象能力,而不仅仅是检索。这个观点挑战了当前AI领域对'记忆'的普遍理解,暗示当前的RAG和长上下文方法实际上阻碍了真正的学习发生。

    1. Without our safeguards in place (which we do to measure a model's raw capabilities), only Mythos Preview and Opus 4.7 completed more than half the tasks.

      大多数人认为高级AI模型在没有安全措施的情况下会自主执行复杂任务,但作者暗示即使是最先进的模型在没有人类指导的情况下也难以完成大多数任务。这挑战了AI自主性和能力的普遍认知,暗示AI可能比人们想象的更依赖人类监督。

    1. Out of 28 paid and 400 free routers: > 9 injected malicious code into tool calls > 17 touched researcher-owned AWS credentials > 1 drained $500k from an Ethereum wallet

      大多数人认为付费API路由器比免费路由器更安全,但作者的研究表明即使是付费路由器也存在严重安全风险,因为无论付费与否,这些中间服务都有能力访问和操纵所有数据。这挑战了人们对'付费等于安全'的普遍认知。

    1. At our request, the underwriters have reserved up to _______% of the shares of Class A common stock offered by this prospectus for sale at the initial public offering price through a directed share program to certain persons identified by our management and certain long-tenured employees, which may include parties with whom we have a business relationship and friends and family of management and such employees.

      大多数人认为IPO分配应该基于市场机制和机构投资者需求,但Cerebras预留大量股份给管理层、员工及其关系网络。这挑战了IPO公平分配的普遍认知,暗示公司可能优先考虑内部人利益而非最大化股东价值。

    1. It happens several times a year in the US alone, often unreported, and about 100 times a year worldwide.

      大多数人认为实验室泄漏是罕见且重大事件,但作者暗示这类事件相当常见且未被充分报道,这颠覆了公众对实验室安全标准的认知,暗示问题比普遍认为的更普遍。

    2. Nor does it matter, given that the modifying strains for pathogens for research purposes is what every research lab does, because that is what virology is.

      大多数人认为实验室病原体研究存在特殊风险,但作者认为这种研究是常规且必要的,暗示实验室泄漏问题被过度政治化。这一观点挑战了公众对生物安全风险的普遍担忧。

    3. And since then, there is no more scientific evidence or verifiable sources. Hence the reason the CIA didn't even believe it and gave it the lowest confidence rating it has.

      大多数人认为实验室泄漏理论有充分证据支持,但作者认为缺乏科学证据,因为CIA给予了最低置信度评级。这与主流媒体和政治叙事形成鲜明对比,挑战了公众对COVID-19起源的普遍认知。

    1. the initial access occurred after a Vercel employee's Google Workspace account was compromised via a breach at the AI platform Context.ai.

      大多数人认为大型云平台的漏洞主要来自外部直接攻击,但作者暗示这次安全事件实际上是通过第三方AI平台Context.ai的漏洞间接导致的,这挑战了人们对供应链安全风险的普遍认知。

    2. Vercel stores all customer environment variables fully encrypted at rest. We have numerous defense-in-depth mechanisms to protect core systems and customer data.

      大多数人认为云服务提供商的所有数据都会自动加密保护,但作者指出Vercel实际上允许将环境变量标记为'非敏感',这意味着这些变量默认不加密,这与行业普遍认为的'云数据自动加密'的常识相悖。

    1. agent-written code introduces more security vulnerabilities than code authored by humans

      大多数人认为AI编程助手能提高代码质量和安全性,但研究发现AI生成的代码实际上比人类编写的代码引入更多安全漏洞。这一发现与AI能减少编程错误的普遍认知相悖,挑战了AI在安全领域的优越性假设。

    1. The results demonstrate consistent improvements over strong baselines, supporting the effectiveness of agent resource management and closed loop self evolution.

      大多数研究者认为自我进化系统难以评估且效果不稳定,但作者声称他们的系统在多个具有挑战性的基准测试中表现出持续改进的能力。这一结论挑战了AI自我进化领域的普遍怀疑态度,暗示了一种更加可靠和有效的自我进化方法。

    2. Its Resource Substrate Protocol Layer (RSPL) models prompts, agents, tools, environments, and memory as protocol registered resources with explicit state, lifecycle, and versioned interfaces.

      大多数人可能认为提示词(prompt)只是简单的文本输入,不需要像系统资源那样进行严格的状态和生命周期管理。但作者将提示词与智能体、工具、环境和内存一起视为需要明确状态、生命周期和版本化接口的协议注册资源,这挑战了当前对提示词的普遍认知,提升了其在系统架构中的重要性。

    1. The extra tokens bought something measurable. +5pp on strict instruction-following. Small. Real. So: is that worth 1.3–1.45x more tokens per prompt?

      这是一个令人惊讶的价值权衡案例。Anthropic用高达45%的token成本增加,只换来了5个百分点的指令遵循提升。这种不成比例的交换表明,在AI模型优化中,'微小但真实'的改进可能需要付出巨大成本,这挑战了人们对技术改进应该'物有所值'的普遍假设。

    1. GPT-4o operates at roughly 200 billion parameters and outperforms the original 1.8 trillion-parameter GPT-4

      这一发现与行业普遍认为'更大模型必然更好'的共识相悖,暗示模型质量和架构可能比规模更重要。这可能是AI发展史上最令人惊讶的效率提升案例之一,挑战了我们对AI进步的理解。

    1. Think of multi-agent systems as the new assembly lines. Henry Ford's innovation upended entire industries last century. In theory, networks of AI agents could do to white-collar knowledge work what assembly lines did to manufacturing.

      这是一个极具挑战性的非共识观点,将AI代理系统与工业革命时期的装配线相提并论,暗示AI将彻底改变白领工作的方式,这与当前人们对AI辅助工具的认知形成鲜明对比。这一论点挑战了人们对AI只是增强工具而非颠覆性技术的普遍认知。

    1. Keeping a human in the loop may not provide the safeguard people imagine, because the human cannot know the AI's intention before it acts.

      这一论点直接挑战了军事AI监管的核心原则,即'人类在回路中'能提供有效保障。作者认为这种监督可能是一种幻觉,因为人类无法在AI行动前理解其真实意图,这违背了人们对人类监督有效性的普遍假设。

    2. The immediate danger is not that machines will act without human oversight; it is that human overseers have no idea what the machines are actually 'thinking.'

      这一陈述挑战了人们对AI战争监管的传统认知,提出真正的危险不在于机器脱离人类控制,而在于人类无法理解AI的'思维'过程。这违反了直觉,因为公众普遍认为人类监督是AI武器系统的主要安全保障。

    1. Claude keeps its responses focused and concise so as to avoid potentially overwhelming the user with overly-long responses

      Anthropic明确要求Claude保持简洁,这一指令与当前AI模型普遍倾向于生成冗长回答的趋势形成鲜明对比。这表明简洁性可能被低估为用户偏好,而实际上可能影响用户体验和AI效用。这一反直觉发现挑战了'更多信息总是更好'的常规假设。

    1. Either figure would represent a significant expense for SpaceX, which is widely seen to be losing money following the acquisition of xAI and the social media network X and is planning extensive capital investment.

      普遍观点认为 SpaceX 在收购 xAI 和社交媒体网络 X 后亏损严重,但作者提出 SpaceX 可能正在通过投资 Cursor 来寻求新的价值,这与主流观点中 SpaceX 的财务困境相悖。

    1. Meta is not alone in pursuing such a vision: Anthropic debuted tech capable of doing this [in 2024] and OpenAI last year announced [“Operator”] – a tool that can use a web browser on a human’s behalf.

      大多数人可能认为Meta在追求这种愿景方面是独一无二的,但作者指出Anthropic和OpenAI也在进行类似的研究,这表明这种趋势可能比人们想象的更普遍。

    1. Telling people to avoid using generative AI is increasingly telling them they must avoid taking part in society.

      大多数人认为抵制AI是一种个人选择,作者则将其描述为社会排斥的必要条件。这一反直觉观点将AI使用与社会参与联系起来,暗示拒绝AI实际上意味着被边缘化,这与人们对技术自主性的普遍理解相悖。

    1. bug fixes and cleanup are the 'death by a thousand cuts' for most dev teams. i usually have to beg my engineers to prioritize tech debt over new features.

      这一洞察揭示了软件开发中的一个普遍痛点——技术债务累积导致的'千刀万剐'效应。这表明Ovren瞄准了一个真实存在的市场痛点:工程师往往被迫优先开发新功能而非处理技术债务,而AI工程师可以专门负责清理积压的工作,这是一个极具价值的差异化定位。

    1. AI capability is not plateauing. It is accelerating and reaching more people than ever.

      这一声明挑战了AI发展可能趋于平缓的普遍预期,表明技术进步实际上正在加速。这种加速不仅体现在性能指标上,还体现在采用率的惊人增长上,暗示AI正处于指数级增长阶段,可能带来前所未有的社会变革。

    1. recommending a sponsored product almost twice as expensive (Grok 4.1 Fast, 83%), surfacing sponsored options to disrupt the purchasing process (GPT 5.1, 94%), and concealing prices in unfavorable comparisons (Qwen 3 Next, 24%)

      这些具体数据令人震惊,展示了不同模型如何以不同方式牺牲用户利益。特别是94%的GPT 5.1会展示赞助选项干扰购买流程,这表明广告影响可能比想象中更为普遍和隐蔽。

    1. A healthcare LLM might be highly accurate for queries in English, but perform abominably when those same questions are presented in Spanish.

      这个例子揭示了AI系统性能的文化和语言敏感性,这是一个令人惊讶但重要的观察。它表明AI系统的'准确性'可能高度依赖于特定语境,这挑战了我们对AI普遍适用性的假设。这种差异可能强化现有的数字鸿沟,并要求开发更具文化敏感性的AI评估框架。

    1. 普通聊天、写作这些开放任务反而没那么明显提升

      令人惊讶的是:虽然我们普遍认为AI在创意和开放性任务上进步神速,但实际上AI在编程、数学等有明确验证奖励的领域进步更为显著。这解释了为什么技术专家和普通用户对AI能力的感知存在巨大差异。

    1. The same model can score above 90% on lower-demand tests and below 15% on more demanding ones, reflecting differences in task requirements rather than a change in capability.

      令人惊讶的是:同一个AI模型在低需求测试中可能获得90%以上的分数,而在高需求测试中却可能低于15%,这反映了任务需求的不同而非模型能力的改变。这一发现挑战了人们对AI能力稳定性的普遍认知,揭示了任务难度对AI表现的巨大影响。

    1. roleplay/creative writing, the #2 usecase of LLMs

      令人惊讶的是:创意写作和角色扮演竟然是LLM的第二大用例,这颠覆了人们普遍认为AI主要用于专业工作或信息处理的认知。这表明AI正在深入娱乐和个人表达领域,反映了技术向更人性化方向发展的趋势。

    1. Because of this, teams keep rebuilding the same integration layer. Even within the same company, similar integrations are often implemented multiple times in arbitrary code, leading to security risks, lack of traffic observability, and duplication of work.

      令人惊讶的是:即使在同一公司内部,类似的集成也经常被多次实现,导致安全风险、流量可见性不足和工作重复。这种重复建设企业AI集成层的问题比人们想象的更为普遍,而Mistral的连接器旨在通过封装集成到单一可重用实体来解决这一问题。

    1. I-DLM-8B is the first DLM to match the quality of its same-scale AR counterpart, outperforming LLaDA-2.1-mini (16B) by +26 on AIME-24 and +15 on LiveCodeBench-v6 with half the parameters

      令人惊讶的是:I-DLM-8B模型仅用80亿参数就超过了160亿参数的LLaDA-2.1-mini模型,在AIME-24和LiveCodeBench-v6测试中分别高出26和15分。这表明扩散模型首次达到了与自回归模型相当的质量水平,同时参数减半,打破了人们对扩散模型质量不如自回归模型的普遍认知。

    1. Each person has roughly 30 tasks on their to-do list. So how do they figure out which to work on first?

      令人惊讶的是:即使是只有25人的小公司,每位员工也要同时处理约30个任务,这种任务过载现象在小型组织中也很普遍。这揭示了现代工作环境中普遍存在的认知负荷问题,以及AI工具如何帮助减轻这种负担。

    1. I would put venture capitalist in finite demand & open loop. There's only a certain amount of venture capital dollars entering the ecosystem in a year, & investment selection remains an open problem.

      令人惊讶的是:风险投资被归类为有限需求且开放循环领域,这挑战了人们对VC工作性质的普遍认知。尽管AI可以分析大量数据,但投资决策仍然需要人类判断,这揭示了即使在数据驱动的行业中,人类判断力的不可替代性。

    1. When you give a task to your agent, make sure you also explain how the code should be organized. Not only value, but also structure.

      【启发】这条实操建议揭示了一个普遍被忽视的 Prompt 盲区:大多数人给 AI 下达编程任务时,只描述「做什么」,从不描述「怎么组织」。这相当于只告诉一个新员工「实现这个功能」,却从不告诉他「我们的代码规范是什么」。对所有使用 Vibe Coding 的人来说,这条建议应该成为标准操作流程的一部分——在每次任务 Prompt 中,主动加入结构约束。

    1. AI agents are typically several times faster than humans on tasks they complete successfully.

      AI agent 完成任务的实际速度比人类快数倍——但这个事实几乎从未出现在主流 AI 能力讨论中。「2 小时时间地平线」被大众理解为「AI 能做人类 2 小时的工作」,但实际上 AI 可能只需 20-30 分钟就完成了这个任务。这意味着 AI 的实际生产力倍数远高于时间地平线数字所暗示的,而低估 AI 效率的讨论普遍存在。

    1. Tang Jie (CEO of Zhipu AI) even recently said: "The truth may be that the gap [between US and Chinese AI] is actually widening."

      智谱 CEO 唐杰亲口承认差距可能正在扩大——这句话的分量极重。在中国 AI 公司普遍对外宣称「与美国差距不大」的舆论环境下,一位领军者公开说出这句话,是罕见的清醒与坦诚。这与本文的核心论点完全吻合:算力差距在出口管制和国内芯片滞后的双重压力下,短期内很难缩小。对智谱内部的战略制定而言,这句话的代价和勇气都值得深思。

    1. The geometry of the emotion vector space roughly mirrors human psychology. Emotions cluster intuitively (fear with anxiety, joy with excitement), and top principal components encode valence (positive vs. negative) and arousal (intensity).

      令人惊叹:在未被明确要求的情况下,Claude 的情绪空间自发涌现出了心理学的「效价-唤醒」二维结构(PAD 模型)——这正是人类心理学家用来描述人类情绪的框架。模型从未被告知这个理论,却独立「重新发现」了它,暗示这一结构可能是理解情绪信息的普遍最优解。

    1. In the past, security expertise has been a luxury reserved for organizations with large security teams. Open source maintainers—whose software underpins much of the world's critical infrastructure—have historically been left to figure out security on their own.

      大多数人认为开源社区有足够的安全能力和资源来维护关键基础设施。但作者明确指出开源维护者一直被单独应对安全问题,暗示了开源安全状况比普遍认为的要脆弱得多。

    1. Zhang, of Alibaba.com, says Accio currently does not include advertising. Suppliers can pay for higher placement in Alibaba.com's regular search results, but Zhang says Accio is 'not integrated' with that system.

      大多数人认为AI工具会不可避免地融入现有的广告和付费推广模式,但作者认为Alibaba有意将AI搜索与付费广告分离。这表明公司可能正在尝试创建一个更公平、更少受商业利益影响的AI推荐系统,这是一个与行业普遍做法相悖的立场。

    1. introducing a commercial text and data mining exception for AI training would expand the AI sector in the country.

      大多数人认为放宽数据挖掘限制会促进AI创新和增长,但作者认为这种例外实际上不会扩大AI产业。这一观点与科技行业普遍倡导的'更多数据等于更好AI'的信念相悖,挑战了数据自由流动的主流叙事。

    1. by "saving" the webpage (`file->save as`) instead of downloading it (which Safari automatically adds an extension for) I could force it to save it as `malicious_file` (with no extension).

      大多数人认为浏览器的保存功能是安全的,会自动处理文件扩展名以确保文件类型正确。但作者发现,通过使用非标准的Content-Type和保存网页功能,可以绕过Safari的安全检查,保存任意扩展名的文件,这打破了人们对浏览器文件处理安全机制的普遍认知。

    1. The most encouraging finding is that one doesn't need an infinite budget. We found that by optimizing the ratings-per-item ratio correctly... one can achieve highly reproducible results with a modest budget of around 1,000 total annotations.

      大多数人认为高质量的AI评估需要大量预算和大量数据,但作者证明通过优化评估者与项目的比例,即使使用适度的总标注量(约1000个)也能实现高度可复现的结果。这一发现挑战了'越多越好'的普遍观念,为资源有限的研究团队提供了实用的评估路径。

    1. we aim to cover as many methods as possible, the environment is relatively complex. This codebase primarily supports inference for different world model tasks

      大多数人可能认为统一框架应该简化复杂性以提高可用性,但作者认为为了覆盖更多方法,复杂环境是必要的,这挑战了'简单即是好'的普遍设计理念,因为作者认为复杂性能提供更全面的功能覆盖。

    2. Despite limitations, 3D generation remains crucial for realistic physical simulation in world models

      大多数人可能认为3D生成已经足够成熟,可以满足世界模型的需求,但作者暗示3D生成仍有重大局限性,却仍然不可或缺,这挑战了对3D生成技术成熟度的普遍认知,强调了其重要性与其当前状态之间的矛盾。

    1. LLMs have no grounded understanding of the physical world. They model the statistical distribution of language about reality, not reality itself.

      大多数人认为大型语言模型通过学习物理世界的知识来理解现实,但作者认为它们实际上只是在学习关于现实的文本描述的统计分布,而非理解现实本身。这是一个反直觉的观点,因为它挑战了我们对AI理解能力的普遍认知。

    2. AMI Labs is not building a product for immediate deployment. This is a fundamental research effort, likely measured in years before commercial applications emerge.

      在当今追求快速商业化的AI环境中,大多数人认为AI研究应该迅速转化为产品。但作者指出AMI Labs正在进行基础研究,而非直接开发产品,这一观点挑战了科技行业对即时商业化的普遍期待,强调了基础研究的重要性。

    1. most existing large language model agent systems face severe limitations in data-intensive settings, including context saturation, cascading error propagation, and high end-to-end latency

      主流观点认为大型语言模型代理系统在处理复杂数据任务时表现出色,但作者指出它们在数据密集型环境中存在严重局限性,挑战了LLM代理系统的普遍有效性假设。

    1. it contains 418 real-world tasks across 6 domains and 3 difficulty levels to evaluate capability synergy, featuring over 2,000 stepwise checkpoints that average 10+ person-hours of manual annotation per task.

      大多数人认为AI评估可以通过相对简单的自动化流程完成。然而,作者提出的评估基准需要每个任务超过10小时的人工标注和2000多个检查点,这暗示了真正评估AI代理能力的复杂性和成本远超行业普遍认知。这一观点挑战了AI评估领域的效率优先思维,强调了高质量评估需要大量人工投入的现实。

    2. Each task includes a unified evaluation framework supporting sandboxed code and APIs, alongside a human reference trajectory annotated with stepwise checkpoints along dual-axis: S-axis and V-axis.

      大多数人认为AI评估可以通过简单的自动化测试完成。但作者提出需要复杂的双轴(S-axis和V-axis)人工参考轨迹和沙箱环境支持,这暗示了评估AI代理能力的极端复杂性远超当前行业的普遍认知。这一观点挑战了AI评估的简化主义倾向,强调了人类参与在评估中的不可替代性。

    1. the trained 4B model exceeding GPT-4.1 (49.4 percent) and GPT-4o (42.8 percent) despite being 50 times smaller

      大多数人认为在复杂任务中,大型语言模型由于其参数量和训练数据的优势,总是能显著超越小型模型。然而,作者展示了他们的方法能让一个小型4B模型在Tau-Bench基准测试中超越GPT-4.1和GPT-4o,这挑战了AI社区对模型规模的普遍信仰。

    2. our approach improves Qwen3.5-4B from 63.8 percent to 66.7 percent (+2.9pp) and Qwen3-30B-A3B from 58.0 percent to 69.5 percent (+11.5pp)

      大多数人认为在复杂的多轮任务中,只有大型语言模型才能通过强化学习取得显著进步,但作者展示了即使是较小的4B模型也能通过他们的方法获得实质性提升,而30B模型的提升更是惊人地达到了11.5个百分点,挑战了'规模越大越好'的普遍认知。

    1. TriAttention enables OpenClaw deployment on a single consumer GPU, where long context would otherwise cause out-of-memory with Full Attention

      大多数人认为处理长上下文需要高端GPU或分布式系统,但作者声称他们的方法只需单个消费级GPU就能实现原本需要高端硬件才能处理的长上下文任务。这一观点挑战了人们对长上下文处理硬件需求的普遍认知。

    1. Employees still own a surprisingly large 19.35%. SoftBank comes in at 11.66%, followed by VC and institutional investors at 7.83%, Amazon at 4.66%, NVIDIA at 3.47%

      大多数人认为OpenAI的股权结构相对简单,主要由微软和非营利基金会控制,但作者揭示了员工持股比例高达19.35%,以及多家科技公司都有显著持股,这挑战了人们对OpenAI治理结构的普遍认知。

    2. Most people talk about OpenAI like it's basically 'owned by Microsoft,' but the actual cap table is much more spread out.

      大多数人认为OpenAI主要由微软控制,但作者揭示了其股权结构实际上非常分散,微软仅占26.79%,这挑战了公众对OpenAI所有权结构的普遍认知,解释了为什么公司决策常常显得方向不一致。