谷歌近日在语言技术领域再掀波澜,宣布推出两款专为即时对话场景设计的AI模型——Gemini 3.8 Live与3.8 Live Extended Thinking,正式向企业及消费市场发起全面攻势。这两款模型通过语音交互实现任务执行,用户仅需语言指令即可驱动系统完成特定操作,标志着谷歌在语音技术商业化布局中迈出关键一步。
在第三方评测机构Artifical Analysis发布的Agentic Performance(τ-Voice)测试中,新模型的表现引发行业关注。该测试通过模拟客服场景,统计AI成功解决用户问题的比例作为核心指标。结果显示,Gemini 3.8 Live Extended Thinking(High)版本以68.6%的解决率登顶榜首,较OpenAI旗下GPT-Live-1 Astra (Medium)的67.9%微弱领先,而与排名第四的xAI模型Grok Voice Think Fast 2.0 (High)56.5%的解决率形成显著差距。不过,标准版Gemini 3.8 Live仅以30.1%的解决率位列第十二,暴露出基础版本在复杂场景中的适应性不足。
此次架构调整凸显谷歌对语音交互市场的战略聚焦。通过将技术路线明确划分为即时响应与深度思考两大方向,企业客户可根据业务需求选择侧重效率或复杂问题处理能力的解决方案,消费端用户则能体验更自然的语音交互服务。行业分析师指出,谷歌通过差异化产品矩阵,试图在OpenAI、xAI等竞品环绕的语音技术赛道中建立独特优势,但基础版本性能短板可能成为其大规模普及的潜在挑战。









