fxp007 21 Aug 2026 in Public getting an LLM to give you a good benchmark score is fairly easy EP.99 故事线C: 好的 benchmark 分数很容易得到,好的真实性能很难得到——这个分离正在系统性地污染 AI 能力的公开叙事。Kimi K3 在 benchmark 上接近 GPT-5.6,但实际使用中差距显著,正是这种现象的体现。 EP99 AI性能失真 Kimi 基准测试 故事线C