Google представила Gemini 3.8 Flash TTS и Flash-Lite TTS для генерации речи
Hacker News · оригинал
Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

Google анонсировала две новые модели синтеза речи в семействе Gemini, ориентированные на глубокую кастомизацию голосов и массовое производство аудио. Модели поддерживают более 100 языков, обеспечивают точный контроль интонаций и оснащены механизмами защиты авторских прав.
Новые инструменты позволяют разработчикам и креаторам создавать уникальные голосовые профили и управлять диалогами на уровне отдельных реплик, что расширяет возможности для локализации контента и создания интерактивных медиа.
Google представила два новых инструмента синтеза речи — Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS, которые расширяют возможности семейства Gemini Audio. По заявлению компании, эти модели трансформируют генерацию голоса из набора статичных пресетов в динамическую среду для творческой работы. Они предназначены для разработчиков, креаторов и корпоративных клиентов, стремящихся создавать более выразительные аудиопроизведения и улучшать пользовательский опыт в сервисах Gemini Notebook и Google Vids.
Модель Gemini 3.8 Flash TTS ориентирована на глубокое творческое управление и дизайн персонажей. Она позволяет создавать голоса с нуля с помощью естественного языка, задавая роль, акцент и характеристики голоса более чем в 100 языках и диалектах. Пользователи могут детально контролировать каждую реплику: от темпа речи до смены диалектов и негласных реакций (backchanneling). В свою очередь, Gemini 3.8 Flash-Lite TTS оптимизирована для высоконагруженных задач и экономичности, что делает её подходящей для массового дубляжа и создания голосовых агентов с тонкой настройкой тона и темпа.
Система предлагает доступ к библиотеке из более чем 2000 готовых к производству голосов, включая региональные варианты, такие как мексиканский испанский, квебекский французский и шотландский английский. Функция репликации голоса позволяет воссоздать уникальный вокальный профиль на основе 30-секундного аудиофрагмента. Для защиты прав владельцев голосов внедрена система верификации согласия: пользователь должен предоставить устное разрешение от владельца голоса, соответствующее референсному спикеру.
В плане качества и точности Google утверждает, что Gemini 3.8 Flash TTS занимает первое место в бенчмарке Voice Design Benchmark от Hume AI с результатом 71.4, а также лидирует в моделировании акцентов (60.8). Обе новые модели заняли первые и вторые места соответственно в индексе общего качества Hume AI. В слепых оценках на платформе Voice Arena модели показали высокие позиции по сравнению с конкурентами в таких языках, как японский, бразильский португальский, вьетнамский, современный стандартный арабский, мексиканский испанский и хинди.
Для обеспечения прозрачности и безопасности каждый аудиоклип, сгенерированный моделями Gemini Audio, маркируется водяным знаком SynthID. Этот невидимый для человеческого уха элемент вплетается непосредственно в аудиопоток, позволяя детектировать синтетическую речь и предотвращать распространение дезинформации. Дополнительно используются C2PA-квалификации для защиты разработчиков и вокальных исполнителей.
Разработчики уже могут тестировать новые возможности в Google AI Studio, где доступен аудиоплейсграунд для создания голосовых идентичностей и редактирования сценариев с двумя спикерами. Интеграция также доступна через Gemini API для платформ вроде Agora, LiveKit, Pipecat и Vercel. Среди партнеров, интегрирующих новые TTS-модели, числятся Figma, HeyGen, Linguana, Wondercraft, 99.co и Ollang. Они используют инструменты для ускорения глобального дубляжа, локализации медиа с учетом региональных акцентов и создания масштабируемых разговорных голосовых агентов.