
Google正式推出两款全新文本转语音(TTS)模型——Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS,旨在将语音生成从静态预设升级为动态创意工作室,为创作者、开发者及企业提供更具表现力的音频体验,并提升Gemini Notebook和Google Vids等产品体验。
双模型定位:创意深度与规模效率
Gemini 3.8 Flash TTS专为深度创意指导和角色设计打造。用户可通过自然语言提示从零创建声音,支持对表演提示、节奏、方言转换及背景回应进行精细的逐行控制,适用于游戏、有声书、播客及互动媒体。
Gemini 3.8 Flash-Lite TTS则针对大规模、高成本效益场景优化,适用于大量配音、音频内容创作及需要细微语气和情感控制的表达型语音代理。
这两款模型进一步丰富了Gemini Audio家族,此前该系列已涵盖3.5 Live Translate、3.5 Transcribe、3.8 Live及3.8 Live Extended Thinking等模型。
核心功能:从声音定制到逐行执导
新模型提供了强大的声音定制与表演控制能力:
- 生成式声音设计:支持通过自然语言自定义角色、口音和声音特征,覆盖超过100种语言和方言,可创造从奇幻角色到特定地域旁白的各类声音。
- 庞大声音库与复刻:提供2,000多个生产就绪声音,涵盖墨西哥西班牙语、魁北克法语等区域变体。仅需30秒音频样本即可重建声音档案,系统内置同意验证、SynthID水印和C2PA凭证以保障权益。
- 逐行表演指导:用户可编写舞台指示或通过自然脚本提示引导交付方式,实现从冷静客服到低声悬疑场景的精准控制。
- 长篇幅与双人对话:在数小时连续音频中保持音色一致且漂移极小;支持原生双人对白编排,无缝指导多轮对话并保持声音清晰分离。
- 非语言提示支持:支持插入<laughs>、<sigh>等非语言提示及|mhm|等主动倾听插入语,增强对话真实感。
- 声音混音(即将推出):允许通过提示微调音色、音调、节奏和口音。
性能表现与安全机制
在Hume AI的Voice Design Benchmark中,Gemini 3.8 Flash TTS以71.4分位居第一,口音建模得分60.8分领先。在总体质量指数中,Flash TTS和Flash-Lite TTS分列前两名,较Gemini 3.1 Flash TTS在长篇幅内容和双人对白控制上有显著改进。
在Voice Arena的盲测人类偏好评估中,两款模型在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语等关键语言中名列前茅。
安全方面,声音复刻需通过口头同意验证,确保参考说话人匹配。所有由Gemini Audio模型生成的音频均嵌入SynthID不可见水印,以确保AI生成语音可被检测,防止虚假信息。
部署与获取
即日起,开发者可在Google AI Studio体验新功能,该界面支持从零创建声音身份或复刻声音,并直接进入双人对白剧本编辑器进行逐行指导。通过Gemini API,Agora、LiveKit、Pipecat、Vercel等平台可轻松部署高性能语音接口。Google正与Figma、HeyGen、Linguana、Wondercraft、99.co和Ollang等公司合作,加速全球配音和本地化媒体整合。
获取方式:
- Gemini 3.8 Flash TTS:今日起逐步推出。开发者可通过Gemini API和Google AI Studio使用;企业用户即将通过Gemini Enterprise API获取;普通用户可在Gemini Notebook中使用。
- Gemini 3.8 Flash-Lite TTS:今日起逐步推出。开发者可通过Gemini API和Google AI Studio使用;企业用户即将通过Gemini Enterprise API获取;普通用户可在Google Vids中使用。