TL;DR:
马斯克又带着新模型冲榜了!Grok Voice Think Fast 2.0在智能体能力测试中荣登榜首,响应快到飞起(0.7秒),价格只要OpenAI的一半。这性价比,开发者直呼真香。
7月30日,马斯克旗下SpaceXAI正式发布新一代语音模型——Grok Voice Think Fast 2.0。1 马斯克亲自上场带货,连发两条推文:“Grok Voice现在在智能体性能方面排名第一”,紧接着喊话:“试试新的Grok Voice”。1 好家伙,这推广力度,堪比头部主播。
那么,这个新模型究竟强在哪里?我们逐项拆解。
速度与效率双飞跃:0.7秒响应,边说边想
语音模型最怕什么?延迟。你一句“查一下天气”,它要思考半天才回答,体验直接拉胯。Think Fast 2.0将首音频响应时间压缩到0.70秒,是排行榜前五名中唯一低于1秒的模型,比前代的1.25秒快了近44%。1 对比竞品:GPT-Realtime-2 High需要1.14秒,GPT-Realtime-2.1 High需要1.21秒——Grok几乎快了一倍。1
不仅如此,Think Fast 2.0支持“边说边推理”,不再像传统模型那样必须先完成推理再生成语音。研发团队还优化了推理Token利用效率,中位数推理Token消耗仅为前代的40%,工具调用能在模型第一句话结束前就开始执行,整体响应时间进一步缩短。1 同时,模型学会多用短句、一次只提一个问题,让对话听起来更自然,更像真人。1
在语音识别方面,Think Fast 2.0的转写准确率相比前代提升约1.4倍,在嘈杂环境下识别误差可降低约10倍。1
智能体能力登顶:开发者实测直呼“飞跃”
如果说速度是基础,那智能体能力才是真正的杀手锏。在衡量智能体性能的Tau Voice基准测试中,Think Fast 2.0以56.5%的得分排名第一,击败了OpenAI、Google、阿里千问等厂商的语音模型。1 在综合能力测试(Speech to Speech Index)中,高推理能力版本以82.9%位列第二,仅次于千问Qwen Audio 3.0。1
AI公司Helionova AI的CEO Nick White第一时间进行了实测。他在产品Tradecraft上完成了全栈语音实时升级,直言“绝对是一次飞跃式的进步”。1 他放出的一段音频中,让Grok Voice扮演投诉的客户,自己当客服,进行多轮电话对话。整个过程模型几乎没有停顿,剧情推进流畅,反应自然。1
另一位开发者则将Think Fast 2.0集成进终端工具,连续下令切换主题、操作屏幕,模型全程对答如流,速度惊人。1 SpaceXAI的软件工程师也表示,团队的“努力、思考和热爱”让模型“几乎让人感觉不真实”。1
价格杀手:比OpenAI便宜一半,开发者笑开花
性能如此强悍,价格会不会劝退?马斯克这次难得“良心”了一回。Think Fast 2.0的定价为每分钟0.08美元(约合每小时输入音频4.80美元),虽然比前代的3.00美元有所上涨,但仅约为GPT-Realtime-2.1 High的45%。1 换句话说,不到一半的价格,却能获得更快的速度和更强的智能体能力,这性价比直接碾压对手。
难怪评论区里,有开发者表示“终于有了新的选择”,还有人想用它生成多角色有声剧,应用场景已经被脑洞打开。1
随着8月5日默认模型完成升级,Think Fast 2.0将正式大规模“服役”。不出意外的话,语音模型的竞争焦点已经彻底转向智能体能力,而Grok暂时站在了潮头。
引用
-
马斯克发Grok新模型,登智能体测评榜首,比OpenAI家便宜一半(https://mp.weixin.qq.com/s?__biz=MzA4MTQ4NjQzMw==&mid=2652807922&idx=2&sn=315914063bcbf32d89fb726ff4e10f71&chksm=85507312e17a5b7f7d42a544e9b2f9b13d5dc307c3dc2c327578f730c1636c2a3c3f44b08878&scene=0&xtrack=1#rd)·智东西·江宇(2026/7/30)·检索日期2026/7/30 ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎