双型号战略:创意与规模分家
9 月 23 日,Google 在官方博客发布了 Gemini 3.8 文本转语音,一次给两个型号:Flash TTS 主打深度创意指导,Flash-Lite TTS 主打高容量、成本高效的规模化生产。两者同属 Gemini Audio 家族,与 3.8 Live、3.8 Live Extended Thinking、3.5 Transcribe 和 3.5 Live Translate 形成完整的语音模型矩阵。
这次发布最有信息量的表述是范式定性:相比上一代 Gemini 3.1 Flash TTS 的静态预设,3.8 是「动态创意工作室」。这不是营销话术——具体能力差异确实拉开了代差。
能力清单:这一代新在哪里
生成式声音设计:用自然语言提示从零定义声音——角色设定、口音、声音特征都可以写进描述,不再受限于预设音色清单。配合即将推出的声音混音功能,还能从库里选声音后微调音色、音高、节奏和口音。
声音库与复刻:2000 多个生产就绪声音,覆盖大量地区变体(墨西哥西语、魁北克法语、苏格兰英语等);授权用户可上传 30 秒样本复刻声纹,内置同意验证、SynthID 不可见水印与 C2PA 凭证。自定义声音可保存复用,减少项目中的音色漂移。
逐行导演与非语言标记:可以逐行写舞台提示控制情绪与节奏,也能让模型按剧本线索自主演绎。脚本化标记支持笑声、叹气、倒吸气:
这是一段测试台词。 <laughs> 真的吗? <sigh> 好吧,我信了。 |mhm|
双说话人场景编排:单一脚本驱动多轮对话,两个声线分离清晰、轮流自然。AI Studio 配了双说话人剧本编辑器,可以逐行导演。
长文本生成:数小时连续音频保持音质与角色音色稳定,官方明确说相比 3.1 在长内容场景有重大改进——这对有声书和播客生产是决定性指标。
基准成绩与语言覆盖
Flash TTS 在 Hume AI 的 Voice Design Benchmark 拿第一(71.4 分),口音建模单项也是第一(60.8 分);在整体质量指数中 Flash 排第一、Flash-Lite 排第二。语言支持 100 多种,Voice Arena 盲测在日语、巴西葡语、越南语、标准阿拉伯语、墨西哥西语、印地语等语言中名列前茅。对中文开发者来说,100 多种语言与丰富的地区变体意味着多语言产品不需要再为小语种单独找供应商。
三个场景的选型建议
多语言配音与视频内容:选 Flash-Lite。发布期五折价(经 Vercel 网关:输入 0.50 美元、输出 6 美元每百万 token),质量指数第二,批量任务的成本曲线是这一代最大的商业卖点。
有声剧、播客、游戏:选 Flash。逐行表演指导、非语言标记、双说话人编排、数小时不漂移的长文本能力,都是叙事类内容的刚需。Hume 基准第一的成绩说明创意控制的精度确实领先。
语音 Agent 与实时交互:这一代 TTS 与 3.8 Live 是分工关系——TTS 负责离线生成高质量音频,Live API(音频输入每百万 token 3 美元、输出 12 美元,约合每分钟 0.005 与 0.018 美元)负责实时对话。做 Agent 不要用 TTS 硬凑实时链路。
生态与部署
开发者入口是 Gemini API 与 AI Studio 的语音生成页,企业版将通过 Gemini Enterprise API 开放(标注即将推出)。第三方平台集成已经铺开:Agora、LiveKit、Pipecat、Vercel 都提供了官方对接文档。产品侧,Notebook 内置 Flash TTS、Google Vids 用 Flash-Lite。安全上,全部输出嵌 SynthID 水印,复刻需语音同意验证,模型卡公开可查。
从 3.1 迁移要注意什么
如果你已有跑在 3.1 Flash TTS 上的业务,迁移路径基本是平替:模型名换成 3.8 对应型号,原有预设音色调用无需重写。但有三处差异要提前评估。第一,3.8 的逐行指导类参数是新增能力,旧调用不会自动获得更好的表现,想吃到质量提升需要在脚本里补表演提示。第二,声音复刻是全新功能,涉及同意验证与地域合规,不能想当然地认为所有市场可用。第三,长文本场景建议先做一轮盲测对比——3.8 在长内容上的改进是官方叙事重点,也正是最值得用你自己的真实脚本验证的部分。
放到竞争格局里看
与专业语音厂商相比,3.8 代的差异点已经很清晰。传统优势厂商(如 ElevenLabs)在声音克隆的自然度上积累深厚,但 Google 这次把复刻、水印、凭证三件套做成了平台默认能力,合规敏感的企业客户会认真考虑这条路线。OpenAI 的 TTS 走的是简单 API 路线,胜在接入成本低,但在声音设计粒度上没有对位 3.8 的逐行导演能力。开源侧的方案(如各种扩散 TTS 模型)胜在可控与免费,但 2000 多个生产就绪声音加 100 多种语言的覆盖,短期内没有开源项目能对齐。
对开发者真正的意义在于:语音生成正在从「能出声」走向「能导演」。3.8 的逐行表演提示、非语言标记、双说话人编排,本质上是把影视行业的导演工作流搬进了 API——写脚本的人同时是导演,声音只是演员。这个抽象如果被市场接受,TTS 供应商之间的比较维度会从「像不像真人」变成「导演工作流好不好用」,而这是 Google 愿意抢先定义的战场。
一句话总结:如果你上一次评估 Google TTS 还停留在 3.1 代的「预设音色加参数调优」,这一代值得重新评估——从能力广度到商业定价,它第一次在创意侧和规模侧同时具备了与专业语音厂商正面对抗的姿态。