Gemini Flash TTS: голоси, клонування й ціна озвучення

Авторка з мікрофоном і робот налаштовують звукову хвилю

Озвучити статтю вже нескладно. Складніше отримати запис, у якому голос тримає характер, правильно вимовляє назви й не змушує перегенеровувати половину тексту. Google націлила нові Gemini 3.8 Flash TTS і Flash-Lite TTS саме на створення керованого аудіо: від короткої репліки до довгого матеріалу.

Реліз відбувся 23 вересня. Нижче — різниця між моделями, розрахунок API-витрат і сценарій перевірки для українського контенту. Власного аудіотесту в цій статті немає, тому якість української вимови не оцінюємо.

Для чого потрібен Gemini Flash TTS

TTS означає text-to-speech — перетворення тексту на мовлення. У документації Gemini API цей режим призначений для озвучення заданого сценарію. Він приймає текст і повертає аудіо; стиль можна спрямовувати налаштуваннями та позначками виконання.

Якщо у вас уже є текст уроку, випуску подкасту чи відео, це відповідний тип інструмента. Для розмови, де користувач перебиває, ставить нові запитання й змінює тему, Google має окремий Live API. Про цей сценарій ми писали в огляді Gemini Live для голосових агентів.

Перед вибором корисно визначити кінцевий результат. Готовий звуковий файл для монтажу та голосова відповідь бота в реальному часі мають різні вимоги до затримки, контролю тексту й обробки помилок.

Чим відрізняються Flash TTS і Flash-Lite TTS

Офіційна картка Google з назвами Gemini 3.8 Flash TTS і Flash-Lite TTS
Джерело: Google.

В анонсі Google Flash TTS орієнтована на створення персонажних голосів, виразність і стабільність довгих записів. Flash-Lite TTS — на великі обсяги з нижчою вартістю. Обидві підтримують керування подачею реплік та сцени з двома голосами.

Завдання Що спробувати спочатку Що слухати
Персонаж або емоційна оповідь Flash TTS Чи зберігається характер без перегравання
Масове озвучення простих текстів Flash-Lite TTS Дикцію, рівний темп і кількість переробок
Курс або довгий подкаст Порівняти обидві Чи змінюється голос між фрагментами
Діалог у готовому сценарії Порівняти обидві Розрізнення мовців і природність пауз

Це запропонований порядок тестування, а не рейтинг якості. Дорожчий варіант має сенс, якщо його перевага чутна у вашому форматі або скорочує ручне виправлення запису. Для спокійної інструкції складна акторська подача може бути взагалі зайвою.

Як працюють дизайн і клонування голосу

Google заявляє понад дві тисячі готових голосів і підтримку більш ніж ста мов та діалектів. У Flash TTS можна описати новий голос текстом або відтворити голос за тридцятисекундним зразком із перевіркою згоди. Для аудіо передбачене маркування SynthID; для реплікації голосу також заявлені дані C2PA.

Дизайн нового голосу та копіювання конкретного голосу — різні можливості. Для першого достатньо описати потрібне звучання: наприклад, спокійний оповідач із виразною дикцією. Для другого потрібен голос, на використання якого ви маєте право, та проходження передбаченої перевірки.

Клонування через AI Studio недоступне в Європейській економічній зоні, Великій Британії, Швейцарії, Індії, Іллінойсі та Техасі. Україна не зазначена серед цих винятків, однак це не підтверджує доступ у конкретному акаунті. Перебуваючи у Франції, також не варто очікувати доступу до цієї функції лише через українську мову профілю.

Скільки коштує хвилина озвучення Gemini TTS

На сторінці тарифів Gemini API до 31 грудня 2026 року вхідний текст коштує $0,50 за мільйон токенів в обох моделях. Аудіовихід у стандартному режимі — $9 за мільйон токенів для Flash і $6 для Flash-Lite. Google рахує 25 аудіотокенів за секунду.

Модель Хвилина аудіо Година аудіо Година з січня 2027
Flash TTS $0,0135 $0,81 $1,62
Flash-Lite TTS $0,009 $0,54 $1,08

Це наш розрахунок лише аудіовиходу за стандартним API-тарифом, без вхідного тексту, повторних генерацій, податків і можливих витрат інших компонентів. З 1 січня 2027 року оприлюднені ставки подвоюються. Для Batch і Flex аудіовихід дешевший, але умови обробки треба враховувати окремо.

Наприклад, десятихвилинний запис Flash коштує $0,135 за аудіовихід однієї генерації. Якщо загалом згенеруєте три повні версії, оплачений обсяг дорівнюватиме тридцяти хвилинам — $0,405. Тому до бюджету серії роликів закладайте також невдалі спроби.

Безкоштовний рівень є, проте квоти залежать від доступу. Тарифи API не означають, що весь інтерфейс Notebook чи іншого застосунку оплачується за цією самою формулою.

Як перевірити українську озвучку перед довгим записом

Почніть у Google AI Studio з короткого уривка й оберіть доступну TTS-модель. Документація рекомендує випробувати генерацію там перед інтеграцією через API. Перший тест краще зробити на готовому голосі: так ви оціните базову вимову, не змішуючи її з якістю клонування.

Для порівняння обох моделей використайте однаковий текст, голосові налаштування та бажаний стиль. Ось редакційний тестовий уривок із числами, власними назвами та англомовними словами:

Сьогодні в Києві ми тестуємо озвучення українською. Зустріч почнеться о чверть на дев’яту. У кошторисі — дві тисячі триста сорок п’ять гривень. Завантажте матеріал у Google Drive, відкрийте ChatGPT і перевірте, чи правильно звучать назви проєктів. А тепер зробімо коротку паузу й перейдемо до наступної думки.

  1. Прослухайте назви й наголоси без фонової музики.
  2. Перевірте, чи не пропущені слова та чи правильно відтворено числа.
  3. Повторіть генерацію, щоб оцінити стабільність звучання.
  4. Додайте довший фрагмент і порівняйте голос на початку та наприкінці.

Початкова вказівка для стилю може бути такою: «Українська мова, спокійна розмовна подача, чітка дикція, помірний темп, без рекламного пафосу». Це опис бажаного результату, який слід перевірити на слух.

Як підготувати текст до монтажу

Перед генерацією приберіть із сценарію службові заголовки, URL та примітки редактора. Складні скорочення розпишіть так, як вони мають звучати. Якщо речення важко прочитати вголос людині, спочатку перепишіть його — налаштування голосу не виправлять невдалий синтаксис.

Для довгого матеріалу зручно тримати логічні фрагменти окремо й зберігати однакові налаштування голосу. Так помилку в одній назві можна виправити локально. Перевіряйте стики: навіть вдалі уривки можуть відрізнятися темпом або гучністю.

Після вибору озвучки переходьте до відеоряду. Якщо збираєте короткі ролики, у нас є практичний матеріал про монтаж Shorts у Клод Cowork і ChatGPT Work. А для вибору TTS залиште собі просте правило: оцінюйте готову хвилину, яку можна використати, разом із часом на виправлення.

Підпишіться на новини про штучний інтелект!

Ви будете отримувати від нас листи раз на тиждень.

Політика конфіденційності

Залишити коментар

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *

Прокрутка до верху