
谷歌正式推出两款全新AI语音助手——Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking,旨在通过即时语音处理和同步思考能力,提供更自然的对话体验并解决复杂任务。目前,这两款模型已向全球开发者和终端用户开放。
Gemini 3.8 Live系列专为低延迟音频输入设计。标准版侧重可扩展性与成本效益,已集成至Google搜索;扩展版(Extended Thinking)则专注于处理复杂工作流,特别是在金融等高难度场景中表现优异。谷歌正将该技术整合进搜索引擎及各类Workspace应用中。
实时交互与后台并行处理
据介绍,Gemini 3.8 Live支持近乎实时的视觉输入处理,并能识别对话中97种语言的无缝切换。其显著优势在于后台并行处理能力:模型可在确认用户请求并继续对话的同时,在后台执行工具调用和API请求,从而提升交互效率。
针对高挑战性问题,Gemini 3.8 Live Extended Thinking引入了“边思考边说话”机制。系统利用简短的口头提示自然填补推理停顿,避免沉默尴尬。在Speech to Speech Quality Index等性能测试中,该模型名列前茅。
多端可用性与企业预览
在可用性方面,标准版已嵌入Google搜索功能。Extended版本则在Gemini Live应用中提供,并向订阅Pro和Ultra高级套餐的用户开放,覆盖Gmail、Docs和Keep等应用。开发者可通过Gemini API访问这两种模型,而企业客户目前仅能通过封闭预览体验新功能。为确保透明度,谷歌在所有生成的音频内容中添加了SynthID数字水印。