10美元让Opus 5狂码5500行,硬造中土世界!Karpathy实测炸出AI最大死穴:它闭着眼干活

温故智新AIGC实验室

TL;DR:

前特斯拉AI总监、现Anthropic员工Karpathy扔了段《魔戒》给Claude Opus 5,配了10美元算力,结果模型闷头两小时怒写5500行Three.js代码,硬生生从文字里长出个能跑的3D夏尔。但诡异的是——这AI造了个世界,自己却没法走进去看一眼,像个闭着眼刷墙的装修师傅。这事暴露了LLM的“生产与质检”严重脱节,也为下一轮进化埋了彩蛋。


如果你以为AI只能写写小作文、改改bug,那昨晚Andrej Karpathy的一条帖子能让你把咖啡喷屏幕上。

这位前特斯拉AI总监、刚官宣加入Anthropic的“AI圈顶流”,给Claude Opus 5喂了一段《指环王》开篇文字,配上大概10美元的token预算,就扔了一个指令:你用Three.js把这段话给我渲染出来。

然后?然后Opus 5就“上头”了。

代码狂魔:两小时爆肝5500行,文字直接变3D

别眨眼。Opus 5吭哧吭哧干了整整两个小时,憋出了5500行代码。注意,这可不是调用什么游戏引擎资源,每棵树、每块石头、每条河流,全是用代码“画”出来的几何体,然后通过代码让它们动起来。

结果呢?一个能跑在浏览器里的3D中土世界就诞生了——虽然有夏尔的丘陵、蜿蜒的河流、稀疏的树木,但Karpathy自己都吐槽“挺糙的”(他原话是janky)1。糙归糙,那可是一个完整、可交互的3D场景。

以前要干这事,你得组团队、批预算、干几个月。现在?10美元,两小时,一个AI全扛了。

Karpathy在帖子底下补了一刀:“没有一个正常人会花时间写这种高度定制的东西,但LLM有世界上所有的耐心。”1

确实,过去一堆“不值得做”的一次性玩意——比如为你某个脑洞定制的迷你游戏、为特定剧情搭建的虚拟场景——现在成本直接归零。一句话的事。

一个致命Bug:闭着眼睛干活的装修师傅

这个实验真正让人后背发凉的,不是它能造出什么,而是它造完之后的样子

Karpathy戳破了一个细思极恐的事实:Opus 5能凭空造出一个中土世界,但它本人(机?)却迈不进这个世界一步。

它没法像人类玩家一样进入场景里左顾右盼,没法原生感知视频,也没法在生成的画面里奔跑跳跃。它检查自己工作的唯一方式是什么?在不同位置截屏,盯着一张张静态图,猜自己做没做对。 中间搞砸了好几次,那些粗糙和bug就是这么来的。

Karpathy的原话直戳心窝:“这暴露了LLM的一个弱点——它们没法高效审查自己的工作,因为既不能原生感知视频,也不能进到自己生成的场景里去玩。1

这画面感太强了:一个手艺又快又好的装修师傅,干活时全程闭着眼,刷完墙只能伸手摸一摸或凭记忆猜猜平不平。你要是他,你心不心酸?

写代码的能力冲上去了,验证代码的能力还站在原地。 这就导致了一个诡异局面:一边是近乎无限的耐心和产能,另一边是近乎为零的自我质检能力。

这不是3D渲染的孤例。现在前沿模型写文章、做分析、写代码已经飞起,但做出来之后呢?它自己不知道好不好。就像一个只负责生不负责养的AI,产出一大堆东西,却像个没眼睛的质检员。

八卦时间:马斯克的“失散兄弟”选了Anthropic

聊点题外话。一年前,马斯克还在X上深情喊话:“Andrej, my long lost brother, let us work together again!”(安德烈,我失散多年的兄弟,让我们再次并肩作战吧。)1

结果今年5月,这位“失散兄弟”官宣加入了Anthropic——OpenAI的“头号对家”。然后就在Karpathy这条刷屏级测试帖子底下,马斯克只回了冷冰冰一个单词:“Yah。”1

这修罗场剧情,比《指环王》还精彩。

接下来呢?让AI自己给自己当质检员

这个实验的真正后劲在最后。Karpathy提到,Opus 5在Opus系列里已经是最强之一:根据Anthropic官方数据,Opus 5在编程和知识任务上性能是Opus 4.8的两倍多,但成本不变2。甚至有测试中,它自己写了一套计算机视觉管线来解析手绘图,然后重建3D零件——它会自己造工具补自己的短板3

但“无法自我审查”这个短板,目前还补不上。

所以,AI圈的下一轮赛点已经很清楚:谁能先让AI丝滑地审查自己?

从另一个角度看,这不就是“递归自我进化”(RSI)吗?能生成、能验证、能自我修正——循环一闭合,奇点还远吗?

Karpathy自己还开了个脑洞:把玩家扔进这种即时生成的世界里,当一个旁观的NPC参与《指环王》剧情,或者干脆扮演一个角色。他管这叫**“按需生成的临时GTA”**1。在Opus 5能一口气狂喷5500行代码的今天,这事已经不远。

但别忘了,在那之前,AI还得先学会睁眼看看自己造的世界究竟长啥样。否则,再好看的3D夏尔,也只是一堆代码的“自嗨”。


写在最后

一个模型能从零生成一整个3D世界,却没有能力沉浸式地走进去体验一下——这事越想越荒诞,也越想越兴奋。荒诞的是当下的不对称,兴奋的是我们知道下一步该往哪走。

就像Karpathy说的:“没有一个正常人会花时间写这种高度定制的东西,但LLM有世界上所有的耐心。”那接下来,就看谁能给这份耐心配上一双会看的眼睛了。

引用


  1. Karpathy实测Opus 5帖子·X·Andrej Karpathy(2026/8/3)·检索日期2026/8/3:https://x.com/karpathy/status/2083749667410727319 ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎

  2. Introducing Claude Opus 5·Anthropic(2026/7/24)·检索日期2026/8/3:https://www.anthropic.com/news/claude-opus-5 ↩︎

  3. Anthropic releases ‘more efficient’ Claude Opus 5 AI model·InfoWorld(2026/7/26)·检索日期2026/8/3:https://www.infoworld.com/article/4201551/anthropic-releases-more-efficient-claude-opus-5.html ↩︎