打破“大小脑”的数字边界:Gemini Robotics 2 开启具身智能的全身进化时代

温故智新AIGC实验室

TL;DR:

谷歌通过 Gemini Robotics 2 实现了从局部感知到全身智能的范式转移,消解了高层语义与底层动作控制的割裂,标志着具身智能正式进入从“能动”向“灵巧且自主”迈进的深水区。

在 WAIC 2026 的聚光灯下,人形机器人的“成人礼”已然宣告结束,行业叙事正在从单纯的机电驱动转向对物理智能的深层定义。Google DeepMind 近期发布的 Gemini Robotics 2 并非一次简单的功能迭代,而是一次对具身智能底层架构的“手术”——它试图彻底拆除长久以来困扰工业界的“大小脑”边界。

从碎片化控制到“全身智能”的本质跃迁

长久以来,具身智能领域被一种“回合制”逻辑所禁锢:大脑负责高层规划(语义理解),小脑负责底层导航与动作(平衡、抓取)。这种分层架构在实验室的桌面任务中尚可应付,但一旦进入复杂的物理世界,这种架构便暴露出巨大的滞后性——机器人每完成一个动作逻辑的闭环,都需要在多个模块间“传话”。

Gemini Robotics 2 带来的核心突破在于“全身智能”(Whole-body Intelligence)。通过视觉-语言-动作(VLA)模型的端到端映射,谷歌将机器人的双腿、躯干、双臂和五指视为一个统一的动作空间。这不仅是算法的集成,更是对物理世界的“深度认知”:机器人不再是“先站稳再伸手”,而是在移动的同时计算重心、预判避障并调整末端执行器的力度。这种_耦合式控制_,正是模拟人类自然身体协调性的关键所在。

商业敏锐度:从“硬件碎片化”到“生态通用性”

对于资本与产业而言,Gemini Robotics 2 最具商业杀伤力的部分在于其“通用性”。过去,每开发一种新型机器人本体,往往需要数月的数据采集与针对性调优。而 Google 提出的 On-Device 2 模型,仅需不到 200 个样例、数小时的训练即可适配迥异的机器人形态。

这种模式极大地降低了具身智能在不同产业落地中的边际成本。正如软件定义汽车(SDV)重塑了出行行业,Gemini Robotics 2 正在开启“模型定义机器人”(Model-defined Robotics)的新阶段。通过将推理、规划与执行集成为一个可快速迁移的智能层,谷歌正试图构建一个凌驾于所有硬件品牌之上的“工业大脑”操作系统。12

迈向“最后几厘米”的深层挑战

尽管模型在灵巧操作上展现了潜力,但数据表现同样揭示了具身智能的残酷真相:在拧灯泡、封口等复杂任务中,成功率的鸿沟依然巨大。13

这不仅是算力问题,更是对物理世界的非结构化特征如何被数字化编码的哲学拷问。人类的直觉式操作——例如处理塑料袋的形变,涉及的是连续接触力学与触觉感知的瞬时反馈。目前的 AI 模型虽然在模仿“动作”,但在“感知物理反馈”的闭环上,仍处于从“看图说话”到“触类旁通”的过渡期。

未来展望:具身智能的进化路径

未来 3-5 年,具身智能将遵循以下演进路径:

  1. 架构融合:端到端模型将继续向上兼容,最终在毫秒级执行与长时段推理之间达成动态平衡。
  2. 多机协作的常态化:随着 ER 2(Embodied Reasoning)等推理模型成熟,多机器人集群将在仓储、物流乃至家庭环境中实现真正的分布式协作。2
  3. 安全边界的重构:当机器人真正“动”起来后,安全性将从物理层强制制动,升级为模型层的安全约束预判。

谷歌的这次尝试,实际上是在重构人机共生的物理接口。当机器人不再是一个僵硬的机械,而是一个能与人类共享空间、理解工作语义并具备身体协调性的“实体智能体”时,它所引发的不仅是生产力的提升,更是对家庭与工厂社会结构的深层重塑。我们正在见证的,是科技史上最艰难的一次跨越:将冰冷的比特,注入温热的碳基世界。

引用


  1. Gemini Robotics 2模型跨入人形機器人全身控制與多機協作 · iThome · 李建興(2026/7/31)· 检索日期2026/8/2 ↩︎ ↩︎

  2. Gemini Robotics 2 brings whole body intelligence to robots · Google DeepMind(2026/7/30)· 检索日期2026/8/2 ↩︎ ↩︎

  3. 速递|Google发布具身AI新模型Robotics 2和ER 2,让机器人具备全身控制、推理与多步骤规划能力 · 腾讯新闻 · ZPotentials(2026/7/31)· 检索日期2026/8/2 ↩︎