Диктувати текст голосом люди намагаються вже років двадцять. Проблема весь цей час була та сама: машина чесно записувала все підряд — «ееее», «ну як би», обірвані слова, — і замість готового повідомлення виходив стенографічний протокол, який усе одно доводилось вичищати руками. 26 серпня 2026 року Google показала Gemini 3.5 Transcribe — модель, яка перетворює мовлення на текст і сама викидає з нього сміття: слова-паразити, самовиправлення, зайві повтори. На виході не розшифровка, а вже причесаний текст.
Це не косметичне оновлення старого движка розпізнавання мови, а зміна самої постановки задачі. Стара система відповідала на питання «які звуки пролунали». Нова відповідає на питання «що людина хотіла сказати».
🎧 Прослухати аудіоогляд новини
Що таке Gemini 3.5 Transcribe і чим воно відрізняється від звичайного «голос у текст»
Gemini 3.5 Transcribe — це окрема модель у сімействі Джеміні (Gemini) від Google, заточена під одну річ: аудіо на вході, текст на виході. Не діалог, не генерація картинок, не роздуми — саме транскрипція, але зроблена «розумно».

Різниця з класичним speech-to-text простіше за все видно на прикладі. Ви диктуєте: «давай зустрінемось у вівторок… ееее, ні, у середу, бо у вівторок я на зустрічі». Старий движок запише це слово в слово, разом з «ееее» і обома днями. Gemini 3.5 Transcribe розуміє, що «ні, у середу» скасовує попереднє, і віддає нормальне речення: «Давай зустрінемось у середу».
Під капотом там три речі, які працюють разом:
- Прибирання слів-паразитів. «Емм», «ааа», «ну», кашель посеред фрази — усе це просто не потрапляє в підсумковий текст.
- Обробка самовиправлень. Модель відстежує, коли людина передумала посеред речення, і лишає тільки фінальну версію думки.
- Автоматичне форматування. Розділові знаки, великі літери, абзаци, списки — модель розставляє їх сама, без окремого етапу «причісування».
Плюс автовизначення мови: не треба заздалегідь казати системі, що зараз буде іспанська. Модель заявлена як така, що працює з понад 85 мовами й уміє в code-switching — коли людина посеред речення перескакує з однієї мови на іншу.
Скільки помилок насправді: 2,6% і чому цифра не така проста
Google називає Gemini 3.5 Transcribe своєю найточнішою моделлю розпізнавання мовлення. Конкретні цифри такі:
| Режим | Word Error Rate (загальний) | Word Error Rate (бенчмарк FLEURS) |
|---|---|---|
| Обробка готового файлу | 2,6% | 5,04% |
| Потокова транскрипція в реальному часі | 4,0% | 5,50% |
Word Error Rate, або WER, — це частка слів, які модель почула неправильно. 2,6% означає приблизно одне помилкове слово на кожні сорок. Для порівняння: людина-транскрибатор на чистому записі дає близько 4%, тож заявка серйозна.
Але зверніть увагу на другу колонку. FLEURS — це багатомовний бенчмарк, де мов багато, а записи різні за якістю, і там похибка вже вдвічі більша. Це нормальна ситуація для будь-якої моделі, просто варто розуміти: 2,6% — це не та цифра, яку ви побачите на записі наради з поганим мікрофоном і трьома людьми, що перебивають одне одного.
Друга заявлена цифра — швидкість. Google каже про на 70% швидший час до фінальної транскрипції порівняно з попередньою моделлю Chirp 3. Для диктування це відчувається як «текст з’являється майже одразу», а не «через секунду після того, як ви замовкли».
Ще одна деталь, про яку варто сказати чесно: у матеріалах запуску немає прямого порівняння з Whisper від OpenAI чи іншими конкурентами. Усі цифри — це вимірювання Google на бенчмарках Google. Якщо вам треба ухвалити рішення для продукту, найнадійніший шлях — прогнати через API свої власні записи й порівняти самому.
Де це вже працює: Gboard, Gemini на macOS і Chrome на черзі
Найцікавіше, що модель поїхала не тільки в API для розробників, а одразу в продукти, якими користуються звичайні люди.
- Gboard Rambler на Android. Це режим клавіатури Google, де ви просто говорите вголос — довго, плутано, з паузами, — а на екрані з’являється чистий відформатований текст. Назва Rambler («той, хто розводить теревені») тут абсолютно буквальна: сенс саме в тому, щоб дозволити людині говорити безладно.
- Застосунок Gemini на macOS. Той самий механізм диктування на комп’ютері.
- Chrome — наступний на черзі. Google обіцяє диктування голосом у будь-яке текстове поле браузера: відповісти на лист, накидати пост, поставити запит до Джеміні. Конкретної дати немає, формулювання — «coming next».
- Корпоративний контур. Модель доступна в Gemini Enterprise Agent Platform, а для сервісів підтримки клієнтів обіцяна «незабаром».
Окремо Google перерахувала партнерів, які вже підключили модель через Live API: LiveKit, Pipecat, Vercel, LangChain, Agora, Fishjam і Vision Agents. Це майже повний список того, на чому сьогодні будують голосових ботів, тож модель, найімовірніше, доїде до вас не через Google, а через сервіс, яким ви вже користуєтесь.
Що дає розробникам: дві моделі, ліміти й нюанси
Модель існує у двох варіантах, і плутати їх не варто — у них різні можливості й різна ціна.
| Параметр | gemini-3.5-transcribe (файл) | gemini-3.5-transcribe-live (потік) |
|---|---|---|
| Максимальна довжина | до 1 години на запит | 10 хвилин на сесію |
| Розділення дикторів | так, до 8 голосів | ні |
| Таймкоди по словах | так | ні |
| Власний словник | так, до 1000 термінів | так |
| Прибирання слів-паразитів | так | так |
Три речі, на які варто звернути увагу перед тим, як щось на цьому будувати.
Розділення дикторів має підводний камінь. Формально модель тримає до восьми голосів, але Google прямо пише: коректна атрибуція реплік для трьох і більше учасників — експериментальна. Тобто діалог двох людей вона розкладе надійно, а нараду на шістьох — як пощастить.
Таймкоди по словах псують точність. Це не побічний ефект, а зафіксоване в документації обмеження: щойно вмикаєте word-level timestamps, якість транскрипції просідає. І ліміт файлу падає з години до 30 хвилин — так само, як при вмиканні розділення дикторів.
Власний словник — недооцінена штука. Туди можна закинути до тисячі термінів: назви препаратів, прізвища, внутрішній жаргон компанії, специфічні написання. Google при цьому радить не набивати ліміт під зав’язку — оптимально працює приблизно сотня термінів. Якщо ви колись мучились із тим, що система вперто пише «Гончаренко» замість «Гончаров», це рішення саме для такого випадку.
І ще один момент, де джерела між собою не сходяться. В офіційному блозі Google згадує, що модель уміє делегувати задачі іншим моделям Gemini через виклик функцій — наприклад, попросити згенерувати картинку. А в довідці Gemini API таблиця можливостей позначає function calling як такий, що не підтримується, разом із кешуванням, виконанням коду, пошуком по файлах і режимом «думання». Схоже, у публічному прев’ю це працює не скрізь однаково. Якщо ви розраховуєте саме на цю поведінку — закладайте час на перевірку, а не на віру в прес-реліз.
Скільки коштує
Ціни Google дає у двох виглядах — за мільйон токенів і за хвилину. Друге для транскрипції зрозуміліше.
| Модель | Вхід (аудіо) | Вихід (текст) | Виходить за годину аудіо |
|---|---|---|---|
| gemini-3.5-transcribe | $0,003 / хв | $0,002 / хв | близько $0,30 |
| gemini-3.5-transcribe-live | $0,005 / хв | $0,004 / хв | близько $0,54 |
Тридцять центів за годину розшифрованого аудіо — це та цифра, яку варто запам’ятати. Двогодинний подкаст обійдеться приблизно в шістдесят центів. Архів зі ста годин записаних нарад — близько тридцяти доларів. Для порівняння: жива людина за годину транскрипції візьме від двадцяти доларів і вище.
Обидві моделі мають безкоштовний рівень із лімітами — тобто спробувати можна взагалі без карти, через Google AI Studio.
Чи є українська серед 85 мов
Тут доводиться відповідати обережно. Повного переліку 85 мов Google не опублікувала — ні в блозі, ні в документації API. У прикладах згадані англійська, іспанська, французька, турецька, китайська та японська, української серед названих прикладів немає.
Що ми знаємо напевно: українську підтримує сама екосистема Джеміні, і голосове введення Gboard українською працює давно. Плюс FLEURS, бенчмарк, на якому Google міряла похибку, — багатомовний і українську включає. Тож ймовірність, що українська в цих 85+ мовах є, висока, але офіційного підтвердження саме для Gemini 3.5 Transcribe поки що немає.
Практична порада: не вгадуйте, а перевірте. Модель у безкоштовному рівні доступна через Google AI Studio — залийте хвилину власного українського аудіо й подивіться на результат. Це займе менше часу, ніж пошук офіційного списку мов. До речі, якщо ви студент, у вас може вже бути розширений доступ до інструментів Google — про це ми писали в матеріалі про безкоштовний рік Google AI Plus для студентів в Україні.
Кому це реально знадобиться
Найочевидніший сценарій — той, про який Google говорить найменше: субтитри. Точні таймкоди по словах плюс розділення дикторів — це рівно те, що потрібно, щоб зробити субтитри до відео без ручного вирівнювання. Якщо ви ріжете короткі вертикальні ролики, це закриває найнуднішу частину роботи — ми розбирали цей процес у гайді про монтаж коротких відео для Shorts.
Другий сценарій — наради й інтерв’ю. Година запису за тридцять центів із розділенням на голоси й уже причесаним текстом означає, що розшифровувати вручну більше немає сенсу ні за яких умов.
Третій — голосові інтерфейси. Саме під них модель і робилась: затримка на 70% менша, потоковий режим, партнерство з платформами для голосових агентів. Якщо ви колись розмовляли з ботом підтримки й хотіли його придушити за фразу «вибачте, я вас не зрозумів» — саме цю проблему тут і намагаються полагодити.
І четвертий, найбуденніший — просто диктування. Той випадок, коли ви йдете вулицею, надиктовуєте думку в телефон і отримуєте текст, який не соромно надіслати без правок. До цього моменту голосове введення завжди вимагало «ще трохи причесати». Зараз Google каже, що не вимагає.
Чи так це насправді — з’ясується, коли модель вийде з прев’ю і на неї подивиться не тільки маркетинговий відділ. Але напрямок правильний: розпізнавання мови нарешті перестає бути стенографією і стає перекладом з усного в письмове. А це, якщо чесно, дві дуже різні задачі — і другу досі ніхто нормально не вирішив. Якщо ви порівнюєте інструменти між собою, почитайте також наш гайд про ChatGPT простими словами — там про те, як влаштований головний конкурент Google у цій гонці.





