Gemini 3.8 Live API: можливості й ціна голосового агента

Людина розмовляє з голосовим агентом Gemini

Gemini 3.8 Live — нова модель Google для голосових агентів, які не просто відповідають у реальному часі, а паралельно бачать екран, викликають інструменти й виконують фонові задачі. Головна відмінність від звичайного голосового режиму — розмова не зупиняється, поки агент шукає дані або працює з підключеним сервісом.

Разом із базовою моделлю Google випустила Gemini 3.8 Live Extended Thinking для складніших багатокрокових сценаріїв. Обидві доступні через Gemini API та Google AI Studio, а тариф дозволяє порахувати ціну не лише за токенами, а й приблизно за хвилинами аудіо.

Що змінилося в Gemini 3.8 Live

Google представила моделі 15 вересня 2026 року й уточнила умови доступу 17 вересня. Gemini 3.8 Live створена для масштабних голосових продуктів, де важливі швидка реакція, природний діалог і помірна ціна.

Модель приймає не лише звук. Вона може майже в реальному часі аналізувати зображення та відео. Наприклад, користувач показує камерою обладнання, а агент пояснює, що натиснути, і водночас перевіряє інструкцію або дані з внутрішньої системи.

Це відрізняється від споживчого Gemini Live, про голосове керування поштою й календарем ми вже писали в окремому матеріалі. Тут мова саме про модель і API, на яких розробники можуть будувати власні рішення.

Фонові задачі не переривають розмову

Раніше голосовий агент часто мовчав, доки викликав API, або просив користувача чекати. Gemini 3.8 Live може підтвердити запит, продовжити діалог і паралельно виконувати інструментальний виклик.

Уявімо голосового помічника інтернет-магазину. Клієнт просить перевірити замовлення, потім одразу уточнює адресу доставки. Агент може шукати статус у CRM і водночас слухати нову інформацію. Коли відповідь готова, він повертається до неї без перезапуску розмови.

Модель також автоматично розпізнає перемикання між 97 підтримуваними мовами. Для українського продукту це хороший знак, але не гарантія ідеальної роботи. Перед запуском треба окремо тестувати вимову, назви міст, прізвища, шум, суржик і команди до інструментів.

Для чого потрібна Extended Thinking

Gemini 3.8 Live Extended Thinking розрахована на задачі, де швидкої відповіді замало. Модель може міркувати й говорити одночасно, повідомляти про прогрес і координувати кілька дій.

Це корисно для бронювання, складної підтримки, навчальних пояснень або голосових бізнес-процесів. Агент може перевірити кілька варіантів, викликати різні функції та коментувати хід роботи, не перетворюючи розмову на довгу тишу.

Extended Thinking не слід вмикати для кожного «котра година». Глибше міркування витрачає більше вихідних токенів. Логічний підхід — направляти прості запити в базову 3.8 Live, а складні сценарії передавати версії Extended Thinking.

Скільки коштує Gemini 3.8 Live API

Графік вартості години вхідного аудіо для голосових моделей

На сторінці тарифів Gemini API Google вказує стандартні ставки за мільйон токенів і приблизну ціну хвилини аудіо.

Тип даних Вхід Вихід
Текст $0,75 за 1 млн токенів $4,50 за 1 млн токенів
Аудіо $3 за 1 млн токенів або близько $0,005/хв $12 за 1 млн токенів або близько $0,018/хв
Зображення та відео $1 за 1 млн токенів або близько $0,002/хв Входить у відповідний вихід моделі

Якщо у десятихвилинній розмові людина говорить п’ять хвилин, а агент — ще п’ять, базова оцінка аудіо становить приблизно $0,115: $0,025 за вхід і $0,09 за вихід. Це близько 4,6 долара за 40 таких розмов.

Це не повний кошторис. Окремо можуть додатися текстові токени, пошук, телефонія, передавання аудіо, база даних, CRM та інфраструктура для сесій. Після 5000 безкоштовних пошукових запитів на місяць Google вказує $14 за 1000 запитів до Search, спільних для моделей Gemini 3.x.

Для порівняння з іншою швидкою моделлю Google можна подивитися наш матеріал про ціну Gemini 3.8 Flash.

Де доступні нові голосові моделі

  • Розробникам: Gemini API та Google AI Studio.
  • Компаніям: приватний попередній доступ у Gemini Enterprise; розширення обіцяють пізніше.
  • Звичайним користувачам: Search Live, Gemini Live та окремі функції Workspace залежно від плану.

Google також вбудовує SynthID у згенероване аудіо. Це непомітний водяний знак, за яким можна визначати ШІ-походження запису. Для бізнесу він не скасовує обов’язку повідомляти людині, що вона спілкується з автоматизованою системою.

Кому підійде Gemini 3.8 Live

Модель цікава розробникам голосової підтримки, продажів, навчання й консультацій, де агент має працювати з інструментами під час розмови. Вона також підходить для візуальної допомоги: користувач показує екран або предмет, а система пояснює наступний крок.

Для простого озвучення тексту або транскрипції така модель може бути зайвою. У Google є окремі дешевші моделі для перетворення мовлення на текст. 3.8 Live варто брати тоді, коли потрібен саме двосторонній діалог, контекст і дії.

Перед запуском перевірте три речі: якість української мови, затримку на вашому каналі зв’язку й частку запитів, яким справді потрібне Extended Thinking. Саме ці тести покажуть реальну ціну голосового агента краще за красиву демоверсію.

Підпишіться на новини про штучний інтелект!

Ви будете отримувати від нас листи раз на тиждень.

Політика конфіденційності

Залишити коментар

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *

Прокрутка до верху