Google розширила набір інструментів для роботи зі звуком і представила Gemini 3.8 Flash TTS та Gemini 3.8 Flash-Lite TTS. Нові моделі синтезу мовлення орієнтовані на створення природного голосового контенту для ігор, подкастів, аудіокниг, дубляжу та голосових помічників, причому розробники отримують значно більше контролю над звучанням окремих реплік.

Gemini 3.8 Flash TTS дозволяє створювати власні голосові образи за текстовими вказівками. Можна задавати роль персонажа, акцент, манеру мовлення, темп і характер подачі. Система підтримує понад сотню мов і діалектів, а також пропонує велику бібліотеку готових голосів із різними регіональними особливостями.
Одна з найпомітніших функцій — клонування голосу за коротким зразком аудіо. За даними Google, для створення копії достатньо приблизно 30 секунд запису. Компанія наголошує, що функцію слід використовувати лише для власного голосу або за наявності дозволу від його власника, а система перед створенням копії має перевіряти згоду.
Для боротьби зі зловживаннями згенероване аудіо позначатиметься цифровими засобами. Google використовує SynthID та метадані C2PA, щоб полегшити визначення походження матеріалу. Це особливо важливо для технології, здатної досить точно відтворювати інтонацію, акцент та інші індивідуальні особливості мовлення.
Моделі вміють змінювати виконання буквально для кожної репліки. Система може говорити тихіше або швидше, переходити на шепіт, додавати сміх, зітхання та інші природні реакції. Також підтримується створення тривалого аудіо та діалогів між двома голосами з одного сценарію без необхідності вручну генерувати кожну репліку окремо.
Gemini 3.8 Flash-Lite TTS позиціонується як економніший варіант для масштабних завдань, де потрібно генерувати багато аудіо. Обидві моделі доступні в Google AI Studio та через Gemini API, а низка платформ уже анонсувала їх інтеграцію. Для творців контенту це означає, що синтез голосу поступово переходить від вибору готового диктора до значно гнучкішого конструювання потрібної манери звучання.

4215