
谷歌今日正式推出Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking两款模型,旨在突破语音AI代理的延迟瓶颈。谷歌称,这是迄今最先进的语音处理模型,具备近实时推理能力,可同步处理语音交互与思维过程,并在后台执行第三方工具调用。
基准测试表现亮眼
据谷歌披露的数据,新模型在多项权威基准测试中表现卓越。Gemini 3.8 Live Extended Thinking在Artificial Analysis语音转语音质量指数中以82.6分创下新高,超越GPT-Live-1-Astra和Grok Voice Think Fast 2.0。Gemini 3.8 Live则在Speech Agent Arena基准测试中位居第二,并在ServiceNow的EVA-Bench测试中排名第一。此外,Extended Thinking版本在T-Voice、T-Voice-banking和Big Bench Audio上的得分分别达到68.6%、35.1%和97.7%。
实现“边聊边做”的自然体验
新模型的核心设计目标,是在保持自然对话节奏的同时,于后台并行处理工具及API调用。这意味着AI代理能在持续对话中同步执行任务,避免了用户因等待搜索或查询结果而遭遇的对话中断,从而提供更接近人类通话的流畅体验。
在功能层面,两款模型均支持自动语言检测及对话中途的语种切换,能够理解并生成97种语言的语音。同时,模型支持近实时视觉定位,并能识别“让我查一下”等早期言语线索,以更逼真地响应用户提示。
多渠道上线与定价策略
目前,Gemini 3.8 Live已通过Gemini API和Google AI Studio开放,并作为企业私有预览版集成至Gemini Enterprise和Search Live。Gemini 3.8 Live Extended Thinking除上述渠道外,还面向订阅用户开放Google Workspace(含Docs、Gmail和Keep)及Gemini Live应用程序。开发者可通过Vercel、Agora、LiveKit等合作伙伴平台将模型集成至应用中。值得注意的是,所有生成音频均携带不可见的SynthID水印,以辅助虚假信息检测。
定价方面,标准版Gemini 3.8 Live的音频输入费用为每分钟0.005美元,输出费用为每分钟0.018美元。Extended Thinking模型则额外对推理令牌以及视频、文档等输入内容收费。