Google випустила третю Flash-модель за шість тижнів. Gemini 3.8 Flash з’явилась 2 вересня 2026 року — і найцікавіше в ній не бенчмарки, а цінник із терміном придатності: до 31 грудня API коштує рівно вдвічі дешевше, ніж коштуватиме з січня.
Для того, хто збирає автоматизації на замовлення, це не абстракція. Це різниця між кошторисом, який ви показуєте клієнту сьогодні, і кошторисом, який доведеться переписувати після Нового року.
Що таке Gemini 3.8 Flash і чим вона відрізняється
Flash у Google — це лінійка робочих конячок: моделі, які мають бути достатньо розумними для щоденних задач і достатньо дешевими, щоб їх не шкода запускати тисячі разів на день. Попередній реліз цієї лінійки ми розбирали в матеріалі про три моделі Google для агентів — 3.8 Flash приходить туди ж, тільки з іншим характером.
Головна зміна — модель «працює довше». Google описує це так: на складних задачах вона робить більше кроків міркування та частіше повертається до інструментів, замість того щоб віддати першу-ліпшу відповідь. На практиці це та поведінка, якої чекають від агента: не «згенеруй мені текст», а «розберись із задачею, поки не зійдеться».
Тут ховається перший підводний камінь бюджету. Модель, яка робить більше кроків, витрачає більше токенів на ту саму задачу. Дешевший токен і дешевша задача — це не одне й те саме.
Із заявлених результатів Google називає перевагу над більшими моделями на DeepSWE v1.1, 54,9% на HLE-Verified та кращі показники на фінансовому й юридичному агентних бенчмарках. Це цифри виробника — корисні як орієнтир, не як доказ.
Скільки коштує API і що буде 2027 року
Тарифи розділені надвоє датою 31 грудня 2026 року.
| Період | Вхідні токени | Вихідні токени |
|---|---|---|
| До 31.12.2026 | $0,75 за млн | $3,75 за млн |
| З 01.01.2027 | $1,50 за млн | $7,50 за млн |
Контекстне вікно — мільйон токенів, максимальний обсяг відповіді — 64 тисячі. Мільйон контексту звучить розкішно рівно доти, доки ви не згадаєте, що вхідні токени теж оплачуються: закинути в промпт увесь проєкт «бо влазить» — найшвидший спосіб зробити дешеву модель дорогою.
І ще одне, що постійно плутають: підписка Gemini в застосунку та оплата API — це різні гаманці. Наявність AI Pro не дає безкоштовних викликів API, а витрати на API не списуються з підписки.
Кому доступна модель в Україні
Розробникам — через Gemini API та AI Studio, а також Android Studio й Antigravity. Компаніям — через Gemini Enterprise. Звичайним користувачам модель прилітає в застосунок Gemini, режим AI Mode у пошуку та Google Sheets на планах AI Pro і Ultra.
Україна є в переліку регіонів, де працюють AI Studio та Gemini API, тож зареєструвати ключ і почати рахувати можна вже зараз. Якщо ви ще не мали справи з екосистемою — почніть із загального огляду, що таке Джеміні і як ним користуватись в Україні.
Окремо тримайте в голові ліміти споживчих сервісів: вони живуть за власними правилами й уміють закінчуватись у найнезручніший момент. Свіжий приклад — нові квоти в Gemini Notebook.
Flash Cyber — це не та сама модель
Разом із 3.8 Flash Google показала 3.8 Flash Cyber — окрему модель під кібербезпеку: пошук вразливостей і автоматичне латання коду. Google наводить понад 70% успішних знахідок у внутрішньому тесті на двадцяти мовах програмування, 47,2% pass@1 на CWE-Bench, а команда Chrome Security повідомила про в 2,6 раза більше коректних патчів проти провідних комерційних моделей.
Але доступ до неї — лише через програму Fairwind для перевірених захисників: держоргани, критична інфраструктура, супровідники великих проєктів. Простий висновок: усе, що ви прочитали про Cyber, не стосується звичайної 3.8 Flash. Не переносьте її результати у свою презентацію клієнту.
Як порахувати бюджет автоматизації, а не ціну токена
Порівнювати моделі за ціною за мільйон токенів — те саме, що обирати авто за ціною літра пального. Значення має вартість завершеної задачі: скільки кроків зробить агент, скільки разів переспитає інструмент, скільки контексту тягне за собою кожен виклик.
Робочий спосіб — не рахувати на папері, а виміряти:
- Візьміть одну реальну задачу з вашого потоку, а не синтетичний приклад.
- Прогоніть її повністю на 3.8 Flash і запишіть сумарні вхідні й вихідні токени.
- Помножте на обидва тарифи — теперішній і той, що почне діяти з січня.
- Порівняйте з моделлю, якою користуєтесь зараз, за тією самою задачею.
Наочний приклад того, як виглядає чесний підрахунок на великому обсязі, — кейс Asana, яка закрила п’ять років техборгу: там поруч із результатом названі і бюджет, і кількість агентів, і що саме довелось переробляти руками.
Півроку дешевого тарифу — непоганий привід перенести на Flash саме ті сценарії, де ви досі економили на кількості викликів. Тільки закладіть у кошторис, що з січня та сама автоматизація подорожчає вдвічі — і краще дізнатись це зараз, ніж у січневому рахунку.



