谷歌发布 Gemini 3.8 Flash TTS 模型,支持逐行表演控制

AI 驱动中国 白鹭 447次阅读
分享 Q
AI摘要
由 AI 生成 · 仅供参考

谷歌宣布推出 Gemini 3.8 Flash TTS 和 Flash-Lite TTS 两款全新文本转语音模型。新模型支持自然语言提示生成定制语音,具备逐行指导表演、长篇生成及原生双声音场景编排能力,并在 Hume AI 基准测试中取得领先成绩,旨在为开发者提供更具表现力的音频体验。

驱动中国9月23日消息,谷歌今日正式宣布,其 Gemini 家族新增两款文本转语音(TTS)模型,分别为 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS。这两款模型旨在将语音生成从静态预设转变为动态创意工作室,帮助创作者、开发者和企业打造更具表现力的音频体验,同时优化 Gemini Notebook 和 Google Vids 等产品的用户体验。

两款新模型定位各有侧重。Gemini 3.8 Flash TTS 面向深度创意方向和角色设计,支持通过自然语言提示从头创建全新语音,适用于游戏、沉浸式有声读物、播客和互动媒体等场景,并能对表演提示、节奏、方言转换等进行精细控制。Gemini 3.8 Flash-Lite TTS 则面向大容量、高性价比规模场景,针对大容量配音、音频内容创作和富有表现力的语音代理进行了优化,支持对音调、节奏和表现力细微差别进行精细控制。

在功能特性方面,用户可将原有 30 种原始语音扩展至无限语音库。模型具备生成式语音设计功能,允许用户通过自然语言提示,在 100 多种语言和方言中自定义角色、口音和语音特征。扩展语音库包含 2000 多种现成语音,覆盖墨西哥西班牙语、魁北克法语、苏格兰英语等区域变体。语音复制功能仅需 30 秒音频样本即可重现一致的声音特征,并内置同意验证、SynthID 水印和 C2PA 凭据以保护开发者与声音人才。此外,模型支持保存与管理自定义语音,确保项目一致性,语音混音功能即将推出。

在表演控制层面,两款模型均支持逐行指导表演,用户可编写舞台指导或通过自然脚本提示引导交付,实现从平静客服到悬疑场景等多种演绎。模型具备长篇生成能力,可在数小时连续音频中保持高语音质量、自然节奏和角色音色,扬声器漂移极小。原生双声音场景编排功能可从单个脚本无缝指导多轮对话,保持两种声音清晰分离。脚本化声音爆发和背景反馈功能支持添加非语言提示(如 )和主动倾听插入语,实现精确的喜剧时机和反应节奏。

性能测试显示,Gemini 3.8 Flash TTS 在 Hume AI 的语音设计基准测试中以 71.4 分位居总体第一,在口音建模方面以 60.8 分处于领先地位。在 Hume AI 的整体质量指数中,Gemini 3.8 Flash TTS 和 Flash-Lite TTS 分别占据第一和第二的位置,相比 Gemini 3.1 Flash TTS,在长格式内容和双扬声器剧本控制等用例中有显著改进。在 Voice Arena 的盲法人类偏好评估中,两款模型在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语等主要语言中均占据领先地位。

版权声明:本文由驱动中国整理发布,转载需注明出处与原文链接。如有疑问请联系 editor@qudong.com
本文价值 5 1 人已评
登录后为本文打分
网友评论0 条评论
正在回复 的评论取消
评论加载中…
🔐

登录后参与互动

评论、点赞均可赚积分
连续签到、邀请好友也有奖励 🎁

电脑端: 微信扫码登录 微信内: 一键登录
我要投稿有独家观点或行业线索?向驱动中国投稿,审核采用后署名发布并获积分奖励。 去投稿 ›

微信扫一扫

打开微信「扫一扫」,分享本文到朋友圈或好友