TL;DR:
Claude Fable 5在MirrorCode编程评测中以64%的成功率断层登顶,把第二名GPT-5.6 Sol(24%)远远甩开。更夸张的是,换到冷门语言Ada,它的成绩只从64%降到61%,说明它不是在背答案,而是真正理解了项目。AI编程已经卷到了项目级交付,人类工程师,你们怕了吗?
刚刚,MirrorCode排行榜刷新,Claude Fable 5再次登顶,而且这次不是险胜,是降维打击——64%的绝对成功率,直接打出断层。1
被压在身下的对手有多惨?第二名GPT-5.6 Sol只有24%,还不到Fable 5的三分之一。第四名GPT-5.5更惨,只有10%,甚至被自家前辈GPT-5.4(21%)按在地上摩擦。1
这到底是什么神仙榜单?MirrorCode可不是普通的编程题集,而是一个专门逼AI“从零造项目”的极限测试。模型被关进隔离环境,没网、没源码、没第三方依赖,只有一份高层文档、一部分可见测试,和一个可以反复调用的原程序。它得不断给原程序喂数据、看输出、猜逻辑,然后自己写出一套行为完全一致的新程序。1
而且,所有可见测试和隐藏测试必须100%通过,99.9%都不行。只要漏掉一个边缘案例,整次运行就算失败。1
为了逼模型补上最后几个缺口,比赛直接上狠活:单次预算100亿Token,最长能连跑7天。论文里最贵的一次任务,模型连续跑了19天,花了2600美元。1
比如一个叫gotree的生物信息学工具——约1.6万行Go代码、40多个命令。Claude Opus 4.7用了14小时和251美元,通过了2001项测试中的2000项,完成度99.95%。但还是漏了一个处理日期注释的冷门边界,被100%通关线无情拦下。1
不过,人类工程师干这活要多久?Epoch估计,至少2到17周。1 虽然AI没拿满分,但把按周计的工作压进了十几个小时——这效率,就问你怕不怕?
语料荒漠里的“真学霸”
更让人惊掉下巴的是Fable 5的跨语言表现。拿公开训练数据作参考,Python语料大约是Ada的230倍。按理说,如果模型主要靠记住热门语言的语法来写代码,换成冷门语言Ada,成绩应该断崖式下跌才对。1
但Fable 5在Go语言上解出率64%,换成Ada仍然高达61%,只降了3个百分点。1
这说明了什么?它根本没有在逐句翻译,而是先摸透原程序的工作逻辑,再换一门语言把相同的行为重新造出来。这就是真正的工程思维,而不是记忆复现。1
相比之下,其他模型就没这么稳了。GPT-5.6 Sol从24%降到19%,GPT-5.4从21%降到12%,GPT-5.5从17%掉到5%。语言一换,谁在裸泳一目了然。1
独立评测也印证了这一点:在SWE-Bench Pro上,Fable 5拿下80.3%,而Opus 4.8是69.2%,GPT-5.5只有58.6%。2 在更硬的FrontierCode Diamond上,差距直接翻倍——Fable 5达到29.3%,Opus 4.8仅为13.4%。2
技术圈里有句话糙理不糙的说法:学霸不仅会做题,还能用中英文各做一遍;学渣换了语言就抓瞎。
从“写代码”到“造项目”,交给AI的单位变了
MirrorCode的64%之所以震撼,是因为它量化的不是代码片段,而是完整的软件项目。现在,交给AI的单位已经从一段代码、一个bug,变成“一个下午”、“一周”甚至“整个项目”。1
Cursor已经让数百个Agent协作近一周,从零写出超过100万行、分布在1000个文件里的浏览器代码;Anthropic则让16个Claude Agent并行跑了近2000次会话,最终搭出一套10万行、能够编译Linux 6.9内核的C编译器。1
OpenAI披露的Codex个人用户样本中,70.2%至少提交过一次预计超过一小时人类工作量的任务,25.6%提交过超过八小时的任务。1
还有更极端的例子:Stripe在自己5000万行的Ruby代码库里测试,Fable 5一天就搞定了团队原本要两个月才能完成的迁移工作。3 虽然Fable 5价格不菲——它的定价大约是Opus 4.8的五倍2——但贵有贵的道理。3
Anthropic的产品定位也说明这点:Fable 5隶属于新推出的“Mythos”层级,专为长周期推理、自主编码和复杂任务设计。日常小项目用Opus 4.8性价比更高,但一旦需要大规模重构或迁移,Fable 5的性价比反而更高——毕竟一天抵两个月。2
更有意思的是,Fable 5还有一个双胞胎兄弟叫Mythos 5,能力完全一样,只是卸掉了安全护栏,被锁在Anthropic的Project Glasswing项目里,只给经过审核的合作伙伴用。2 这波操作,老用户看了直呼“会玩”。
代码越来越便宜,会提问的人越来越值钱
MirrorCode的64%像一个信号:只要目标足够明确、结果能够自动验收,前沿模型已经可以独立交付一部分中大型软件。1 以前你需要盯着AI写每一段代码,接下来你更可能只在关键节点检查它有没有跑偏。1
代码会越来越便宜,但那些能把问题说清楚、把结果验明白的人,会越来越值钱。1
所以,当AI都能自己“造项目”时,你准备好当那个“检查作业”的人了吗?
引用
-
刚刚,Claude Fable 5,又拿第一了 (https://mp.weixin.qq.com/s/5cb8P83moTVUZ7iBmTdfbA) · 新智元 · ASI启示录 (2026/8/4) · 检索日期2026/8/4 ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎
-
Claude Fable 5 Review: Best AI Coding Model Yet (https://thomas-wiegold.com/blog/claude-fable-5-review) · Thomas Wiegold Blog · Thomas Wiegold (2026/8/4) · 检索日期2026/8/4 ↩︎ ↩︎ ↩︎ ↩︎ ↩︎
-
刚刚 Claude Fable 5 炸裂发布!真是太烧了。。附一手实测,夯还是拉? (https://zhuanlan.zhihu.com/p/2048024883783847965) · 知乎 (2026/8/4) · 检索日期2026/8/4 ↩︎ ↩︎