
Google 今日正式推出 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,这是其迄今最先进的实时对话模型。两款新模型旨在将近乎实时的推理能力扩展至更广泛场景,通过显著提升智能水平与并行推理能力,使人工智能语音交互更加直观,并能高效执行复杂任务。
双模型策略:兼顾效率与深度推理
Gemini 3.8 Live 专为规模化部署与成本效率设计,融合了对话智能、流畅体验及视觉 Grounding(视觉定位)能力。该模型支持在对话中自动检测并无缝切换 97 种语言,能够近乎实时地处理视觉输入以丰富上下文。其核心优势在于可在后台执行工具和 API 调用的同时保持对话连续性,让用户在任务处理期间仍能进行自然交互。在 Speech Agent Arena 中,该模型排名第二,展现出极高的性价比。
Gemini 3.8 Live Extended Thinking 则面向高复杂度任务,具备更高的智能水平与多步推理能力。它支持“边推理边说话”,在保持不间断对话流的同时,通过早期语音提示(如“让我查一下……”)和实时进度播报,引导用户完成多步后台任务。在 Artificial Analysis 的“语音到语音质量指数”中,该模型以 82.6 分夺得综合排名第一;在代理任务完成率方面,其在 τ-Voice 基准测试中达到 68.6%,在 Sierra 的 τ-Voice-banking 测试中达到 35.1%。此外,其在 Big Bench Audio 测试中得分 97.7%,并在保持前沿性能的同时提供了极具竞争力的价格。
在 ServiceNow 的 EVA-Bench 基准测试中,基于 Gemini Enterprise Agent Platform 上 Live API 运行的模型成功平衡了准确性与对话质量,推动了复杂工作流领域的帕累托前沿。
深度集成 Google 生态与开发者平台
对于普通用户,Live 模型已集成至 Google Search Live、Workspace 及 Gemini 应用中,提供更直观的协作体验。例如,用户可在 Search Live 中获得逐步实时故障排除帮助;在 Workspace 的 Docs、Gmail 和 Keep 中,订阅用户可利用 Extended Thinking 模型进行更复杂的文档处理与邮件管理。
在企业与开发者层面,Agora、Fishjam、LiveKit、Pipecat、Vercel 和 Vision Agents 等平台已接入 Gemini Live API,帮助开发人员构建高性能语音驱动界面,而无需关注底层实时媒体流基础设施。Salesforce、Genspark 和 Lumeris 等合作伙伴也对模型的低延迟、流畅性及工具调用能力表示认可。
安全透明与发布计划
为确保透明度,所有由 Google AI 产品生成的音频均嵌入不可见的 SynthID 水印,以便检测 AI 生成内容并防止虚假信息传播。
两款模型今日起陆续推出:
- Gemini 3.8 Live:面向开发者已在 Gemini API 和 Google AI Studio 可用;面向企业用户在 Gemini Enterprise 中处于私有预览阶段,即将登陆 Gemini Enterprise for Customer Experience;面向公众在 Search Live 中可用。
- Gemini 3.8 Live Extended Thinking:面向开发者已在 Gemini API 和 Google AI Studio 可用;面向企业用户在 Gemini Enterprise 中处于私有预览阶段,即将登陆 Gemini Enterprise for Customer Experience 及 Google Workspace 企业客户;面向公众在 Gemini Live 中可用,Google AI Pro 和 Ultra 订阅用户可在 Workspace 的 Docs 中使用,所有 Google AI 订阅用户可在 Gmail 和 Keep 中使用。