人均“第一”的具身智能:技术还没统一,第一先开启了批发模式

温故智新AIGC实验室

TL;DR:

具身智能圈最近流行“人均第一”,但千寻智能的“世界第一”刚到手就被扒皮,72%评分来自两个账号。刷榜、话术包装、买卖榜单,这届“第一”水分有多大?想不被忽悠,得学会看透榜单的“门道”。

当你在新闻里看到某具身智能公司宣布“世界第一”时,先别急着激动——因为很可能第二天,这个“第一”就被另一家公司取代了。而且,这两个“第一”可能出自同一个榜单,只是不同赛道。

这就是当前具身智能榜单的魔幻现实:技术路线还没统一,各路玩家却已经人手一个“第一”,仿佛“第一”成了公司标配。但仔细一看,这些“第一”的含金量,可能比早高峰的地铁还挤。

01. 当“第一”成为标配,谁在裸泳?

先回顾一个经典案例:今年6月,千寻智能的具身基座模型Spirit v1.6在RoboArena榜单上以1918分的成绩击败了英伟达的Cosmos3,宣称“世界第一”。1 紧接着,千寻宣布完成近50亿元融资,风光无限。2

然而,业内质疑声很快袭来。有人发现,在310次评测记录中,高达72%的分数来自同一个实验室的两个账号。RoboArena官方随后展开调查并移除了存疑数据,Spirit v1.6从此跌出榜单。3

其实,千寻智能的Spirit v1.5早前曾在RoboChallenge评测中登顶,综合得分超过Pi0.5,引起行业关注。4 但这次风波并未浇灭其他公司“造第一”的热情。翻翻近半年的新闻,星动纪元、原力灵机、极佳视界、智元、跨维、鹿明……几乎每一家都曾宣称自己“登顶”某个榜单。2

为什么这么卷?因为具身智能这个赛道目前没有统一的技术标准,真机成功率普遍只有五六成,外界很难直接判断技术实力,只能依赖榜单。2 据不完全统计,目前活跃的具身智能榜单超过20个,分为VLA操作综合榜、世界模型榜和专项基准榜。各有侧重,互不替代。2

问题就出在这里:三大类,20多个榜单,每个榜单还有不同子榜,于是“第一”的帽子可以随意裁剪。比如World Arena榜单,智元在Track1排名第一,跨维在Track2排名第一,两家都对外宣称“登顶World Arena”,但外人根本不知道这是两个不同的赛道。2 更让人迷惑的是,RoboChallenge Table30的榜首在半年内换了四次。2

这种“第一通胀”让榜单的参考价值大打折扣。一位投资人坦言,真正在意“第一”头衔的往往不是财务投资机构,而是地方引导基金——一个“第一”写进报告里,比较好交代。2

02. 造一个“世界第一”,有哪些“潜规则”?

如果以为这些“第一”都是真枪实弹跑出来的,那就太天真了。业内人士总结了三种常见的“造第一”手法。

第一招:话术包装,省掉关键词。

明明拿的是“双臂协同VLA类Clean档第一”,对外直接简化为“登顶XX榜”;将“专项场景第一”扩大为“综合第一”。数据没造假,但范围被放大了一圈。这种手法成本最低,也最普遍。2

第二招:刷题钻漏洞。

由于许多榜单公开了测试任务,厂商可以针对任务专门采集数据、微调模型,相当于“照着答案练习”。这在圈内被视为正常迭代,但效果相当于“开卷考试得高分”。2

更恶劣的是钻评测机制漏洞。以RoboArena为例,它采用开放注册、分布式评测,本意是民主化,但留下了三个空子:任何人可注册当裁判;匹配不强制全覆盖,可选择性避开强敌;可用多账号集中评测自家模型,推高Elo分数。3 千寻事件就是典型:两个账号用224场评测刷出97%胜率,把分数推高。2

第三招:资源置换,直接买榜。

一些媒体榜的评选标准不透明,甚至存在与被评对象的商务合作。双方联合发布“权威报告”,把媒体榜和学术benchmark并列包装。从业者表示,刷榜、买榜并不少见。2

三种手法层层叠加:先刷分,再偷换概念,最后买榜背书。一个光鲜的“世界第一”就这样出炉了。

03. 去掉滤镜,哪些榜单还能“打”?

那么,在“第一”满天飞的现状下,我们还有可信的参照物吗?

从业者给出的判断标准有三点:

第一,分项透明。 好的榜单会告诉你每个细项的得分,而不是只甩一个总分。比如RoboChallenge Table30,该榜单由Dexmal、Hugging Face等机构联合发起,主要评估真实机器人在复杂指令理解等方面的稳定性5,它不仅给出综合成功率64.33%,还列出30项任务各自的成功率,哪项强哪项弱一目了然。2

第二,第三方掌控,有反刷题设计。 比如MolmoSpaces不允许微调,模型只能“裸考”;LIBERO-Plus加入光照、视角等极端扰动,防止死记硬背。2 它们的共同点是让刷题变难,逼出真正的泛化能力。

第三,看机制而不是更新频率。 更新慢的榜不一定好,更新快的榜也不一定可刷。有些榜更新慢是因为真机评测成本高,比如RoboChallenge一次完整评测要数周;有些榜更新快是因为Elo机制的动态排名,但这本身不是问题,问题在于机制是否严密、漏洞是否补上。2

但说到底,榜单只是阶段性的产物。当前行业的本质是资本焦虑:出货量、营收、客户都不稳定,只能拿榜单讲故事。2 据相关统计,中国具身智能公司已超过200家6,当“第一”的数量比认真做机器人的公司还多时,这种泡沫必然难以持续。等到行业成熟,评判标准自然会切换到交付量、客户数和盈利水平。到那时,“第一”的泡沫会自然消散。或许,那些不忙着刷榜、只顾着把机器人送进产线的公司,才是行业真正的答案。2

所以,下次再看到“世界第一”的新闻,不妨多问一句:“哪个榜单?哪个赛道?谁评的?”

也许你会发现,真正的第一,从来不忙着刷榜。

引用


  1. RoboArena登顶梦碎!具身智能的榜单狂欢 https://news.qq.com/rain/a/20260620A05KB600 ·腾讯新闻·(2026/6/20)·检索日期2026/7/21 ↩︎

  2. 人均第一,具身智能榜单能信吗? https://mp.weixin.qq.com/s?__biz=MzkzODUxNTM2OA==&mid=2247540378&idx=1&sn=40416fbd84f604c80755ca867cd47554&chksm=c316a0e729d767425c32a00be1d7e4149ff1b3c18d4cd86eec9cd2b41c32f73f0193e29e454a&scene=0&xtrack=1#rd ·定焦·王璐(2026/7/21)·检索日期2026/7/21 ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎

  3. 击败主场霸主英伟达与PI!千寻智能登上具身智能「奥林匹克」 https://zhuanlan.zhihu.com/p/2045600953148219514 ·知乎专栏·(2026/6/3)·检索日期2026/7/21 ↩︎ ↩︎

  4. 中国具身智能公司千寻智能开源最新模型,超越Pi0.5登顶全球榜单 https://news.qq.com/rain/a/20260112A03VMA00 ·腾讯新闻·(2026/1/12)·检索日期2026/7/21 ↩︎

  5. 具身智能算法哪家强?RoboChallenge见真章!全球首个大... https://zhuanlan.zhihu.com/p/1962077358426137085 ·知乎专栏·(2025/10/16)·检索日期2026/7/21 ↩︎

  6. 2026年,我整理了中国200 多家机器人(具身智能)公司名单 https://zhuanlan.zhihu.com/p/2015798458943046973 ·知乎专栏·(2026/7/21)·检索日期2026/7/21 ↩︎