马斯克旗下SpaceXAI近日宣布推出新一代语音模型Grok Voice Think Fast 2.0,在权威评测机构Artificial Analysis的Tau Voice智能体基准测试中以56.5%的得分排名第一,击败了OpenAI、Google、阿里千问等厂商的语音模型。该模型平均首音频响应时间仅0.70秒,是榜单前五名中唯一低于1秒的模型,定价每分钟0.08美元,约为OpenAI同类产品GPT-Realtime-2.1 High的一半不到。
这一结果释放出一个清晰信号:语音大模型的竞争维度正在发生根本性转变。过去一年,行业的关注点从语音识别准确率、语音合成自然度,快速转向复杂任务处理、多轮实时对话和工具调用能力。模型不再只是听懂你在说什么,而是要在对话过程中同步完成推理、规划、调用外部工具并推动任务执行。
从技术路径看,Think Fast 2.0的核心突破在于边说边推理的流式推理架构。传统语音模型往往需要先完成全部推理再生成语音回复,而Think Fast系列支持在对话进行的同时完成后台推理,中位数推理Token消耗仅为上一代的40%。这意味着工具调用可以在模型第一句话结束前就开始执行,整体响应时间被大幅压缩。在Big Bench Audio语音推理测试中,该模型获得97.2%的得分;在衡量多人实时语音交互体验的Full Duplex Bench上达到95.1%。

这种以智能体实战能力为核心、兼顾响应速度和成本的竞争思路,与星战科技在OPC智能体协作平台上的实践方向高度契合。在多智能体协同场景中,响应延迟和调用成本直接决定了智能体能否在真实业务流程中持续运行,而非停留在演示阶段。
语音模型进入智能体时代后,竞争格局也在重塑。此前语音赛道的主要玩家是传统语音技术公司和少数大模型厂商,而现在,谁能把语音能力与任务执行、工具调用、多轮协作深度结合,谁就能占据下一轮竞争的制高点。多位开发者在实测后反馈,Think Fast 2.0在多轮实时对话中的表现已接近人类客服水平,几乎没有明显停顿,能够根据对话内容持续推进情节并实时作出反馈。

值得注意的还有语音识别能力的同步提升。在覆盖24种语言、数千条短语的测试中,Think Fast 2.0整体转写准确率相比上一代提升约1.4倍,在背景噪声较大、电话压缩等真实场景下,识别误差可降低约10倍。这些改进让语音智能体在客服、电话助手、销售等真实业务场景中的可用性大幅提升,也为大模型API广场中语音类服务的规模化落地提供了基础条件。