Google представила Gemini 3.8 Flash TTS: нові ШІ-моделі можуть створювати та клонувати голоси

Сьогодні,   19:32    113

Google розширила набір інструментів для роботи зі звуком і представила Gemini 3.8 Flash TTS та Gemini 3.8 Flash-Lite TTS. Нові моделі синтезу мовлення орієнтовані на створення природного голосового контенту для ігор, подкастів, аудіокниг, дубляжу та голосових помічників, причому розробники отримують значно більше контролю над звучанням окремих реплік.

Google представила Gemini 3.8 Flash TTS: нові ШІ-моделі можуть створювати та клонувати голоси

Gemini 3.8 Flash TTS дозволяє створювати власні голосові образи за текстовими вказівками. Можна задавати роль персонажа, акцент, манеру мовлення, темп і характер подачі. Система підтримує понад сотню мов і діалектів, а також пропонує велику бібліотеку готових голосів із різними регіональними особливостями.

Останні новини:  ШІ дешевшає швидше за будь-яку іншу проривну технологію: вартість «мислення» падає майже вдвічі щокварталу

Одна з найпомітніших функцій — клонування голосу за коротким зразком аудіо. За даними Google, для створення копії достатньо приблизно 30 секунд запису. Компанія наголошує, що функцію слід використовувати лише для власного голосу або за наявності дозволу від його власника, а система перед створенням копії має перевіряти згоду.

Для боротьби зі зловживаннями згенероване аудіо позначатиметься цифровими засобами. Google використовує SynthID та метадані C2PA, щоб полегшити визначення походження матеріалу. Це особливо важливо для технології, здатної досить точно відтворювати інтонацію, акцент та інші індивідуальні особливості мовлення.

Останні новини:  Коли роботаксі вже можна вважати безпечнішим за людину: індустрія досі не має одного чесного тесту

Моделі вміють змінювати виконання буквально для кожної репліки. Система може говорити тихіше або швидше, переходити на шепіт, додавати сміх, зітхання та інші природні реакції. Також підтримується створення тривалого аудіо та діалогів між двома голосами з одного сценарію без необхідності вручну генерувати кожну репліку окремо.

Gemini 3.8 Flash-Lite TTS позиціонується як економніший варіант для масштабних завдань, де потрібно генерувати багато аудіо. Обидві моделі доступні в Google AI Studio та через Gemini API, а низка платформ уже анонсувала їх інтеграцію. Для творців контенту це означає, що синтез голосу поступово переходить від вибору готового диктора до значно гнучкішого конструювання потрібної манери звучання.

Останні новини:  Ray-Ban Meta Audio відмовилися від камери: нові ШІ-окуляри зробили легшими та витривалішими

https://toneto.net/news/tehnologii/Google-vipustila——model—dlya-sintezu-movi-Gemini-3-8-Flash-TTS—yak—vm—yut-klonuvati-golos-