Gemini 3.8 Flash: ціна API до кінця 2026 і що далі

Розробник рахує вартість автоматизації на Gemini поруч із роботом-помічником

Google випустила третю Flash-модель за шість тижнів. Gemini 3.8 Flash з’явилась 2 вересня 2026 року — і найцікавіше в ній не бенчмарки, а цінник із терміном придатності: до 31 грудня API коштує рівно вдвічі дешевше, ніж коштуватиме з січня.

Для того, хто збирає автоматизації на замовлення, це не абстракція. Це різниця між кошторисом, який ви показуєте клієнту сьогодні, і кошторисом, який доведеться переписувати після Нового року.

Що таке Gemini 3.8 Flash і чим вона відрізняється

Flash у Google — це лінійка робочих конячок: моделі, які мають бути достатньо розумними для щоденних задач і достатньо дешевими, щоб їх не шкода запускати тисячі разів на день. Попередній реліз цієї лінійки ми розбирали в матеріалі про три моделі Google для агентів — 3.8 Flash приходить туди ж, тільки з іншим характером.

Головна зміна — модель «працює довше». Google описує це так: на складних задачах вона робить більше кроків міркування та частіше повертається до інструментів, замість того щоб віддати першу-ліпшу відповідь. На практиці це та поведінка, якої чекають від агента: не «згенеруй мені текст», а «розберись із задачею, поки не зійдеться».

Тут ховається перший підводний камінь бюджету. Модель, яка робить більше кроків, витрачає більше токенів на ту саму задачу. Дешевший токен і дешевша задача — це не одне й те саме.

Із заявлених результатів Google називає перевагу над більшими моделями на DeepSWE v1.1, 54,9% на HLE-Verified та кращі показники на фінансовому й юридичному агентних бенчмарках. Це цифри виробника — корисні як орієнтир, не як доказ.

Скільки коштує API і що буде 2027 року

Тарифи розділені надвоє датою 31 грудня 2026 року.

Період Вхідні токени Вихідні токени
До 31.12.2026 $0,75 за млн $3,75 за млн
З 01.01.2027 $1,50 за млн $7,50 за млн

Контекстне вікно — мільйон токенів, максимальний обсяг відповіді — 64 тисячі. Мільйон контексту звучить розкішно рівно доти, доки ви не згадаєте, що вхідні токени теж оплачуються: закинути в промпт увесь проєкт «бо влазить» — найшвидший спосіб зробити дешеву модель дорогою.

І ще одне, що постійно плутають: підписка Gemini в застосунку та оплата API — це різні гаманці. Наявність AI Pro не дає безкоштовних викликів API, а витрати на API не списуються з підписки.

Кому доступна модель в Україні

Розробникам — через Gemini API та AI Studio, а також Android Studio й Antigravity. Компаніям — через Gemini Enterprise. Звичайним користувачам модель прилітає в застосунок Gemini, режим AI Mode у пошуку та Google Sheets на планах AI Pro і Ultra.

Україна є в переліку регіонів, де працюють AI Studio та Gemini API, тож зареєструвати ключ і почати рахувати можна вже зараз. Якщо ви ще не мали справи з екосистемою — почніть із загального огляду, що таке Джеміні і як ним користуватись в Україні.

Окремо тримайте в голові ліміти споживчих сервісів: вони живуть за власними правилами й уміють закінчуватись у найнезручніший момент. Свіжий приклад — нові квоти в Gemini Notebook.

Flash Cyber — це не та сама модель

Разом із 3.8 Flash Google показала 3.8 Flash Cyber — окрему модель під кібербезпеку: пошук вразливостей і автоматичне латання коду. Google наводить понад 70% успішних знахідок у внутрішньому тесті на двадцяти мовах програмування, 47,2% pass@1 на CWE-Bench, а команда Chrome Security повідомила про в 2,6 раза більше коректних патчів проти провідних комерційних моделей.

Але доступ до неї — лише через програму Fairwind для перевірених захисників: держоргани, критична інфраструктура, супровідники великих проєктів. Простий висновок: усе, що ви прочитали про Cyber, не стосується звичайної 3.8 Flash. Не переносьте її результати у свою презентацію клієнту.

Як порахувати бюджет автоматизації, а не ціну токена

Порівнювати моделі за ціною за мільйон токенів — те саме, що обирати авто за ціною літра пального. Значення має вартість завершеної задачі: скільки кроків зробить агент, скільки разів переспитає інструмент, скільки контексту тягне за собою кожен виклик.

Робочий спосіб — не рахувати на папері, а виміряти:

  • Візьміть одну реальну задачу з вашого потоку, а не синтетичний приклад.
  • Прогоніть її повністю на 3.8 Flash і запишіть сумарні вхідні й вихідні токени.
  • Помножте на обидва тарифи — теперішній і той, що почне діяти з січня.
  • Порівняйте з моделлю, якою користуєтесь зараз, за тією самою задачею.

Наочний приклад того, як виглядає чесний підрахунок на великому обсязі, — кейс Asana, яка закрила п’ять років техборгу: там поруч із результатом названі і бюджет, і кількість агентів, і що саме довелось переробляти руками.

Півроку дешевого тарифу — непоганий привід перенести на Flash саме ті сценарії, де ви досі економили на кількості викликів. Тільки закладіть у кошторис, що з січня та сама автоматизація подорожчає вдвічі — і краще дізнатись це зараз, ніж у січневому рахунку.

Підпишіться на новини про штучний інтелект!

Ви будете отримувати від нас листи раз на тиждень.

Політика конфіденційності

Залишити коментар

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *

Прокрутка до верху