Gemini 3.5 Transcribe: голос у текст без «емм» і 85 мов

Мікрофон і рядки транскрипції, що перетворюються на чистий текст

Диктувати текст голосом люди намагаються вже років двадцять. Проблема весь цей час була та сама: машина чесно записувала все підряд — «ееее», «ну як би», обірвані слова, — і замість готового повідомлення виходив стенографічний протокол, який усе одно доводилось вичищати руками. 26 серпня 2026 року Google показала Gemini 3.5 Transcribe — модель, яка перетворює мовлення на текст і сама викидає з нього сміття: слова-паразити, самовиправлення, зайві повтори. На виході не розшифровка, а вже причесаний текст.

Це не косметичне оновлення старого движка розпізнавання мови, а зміна самої постановки задачі. Стара система відповідала на питання «які звуки пролунали». Нова відповідає на питання «що людина хотіла сказати».

🎧 Прослухати аудіоогляд новини

Що таке Gemini 3.5 Transcribe і чим воно відрізняється від звичайного «голос у текст»

Gemini 3.5 Transcribe — це окрема модель у сімействі Джеміні (Gemini) від Google, заточена під одну річ: аудіо на вході, текст на виході. Не діалог, не генерація картинок, не роздуми — саме транскрипція, але зроблена «розумно».

Абстрактна звукова хвиля у фірмових кольорах Gemini
Промо-зображення з офіційного анонсу Gemini 3.5 Transcribe у блозі Google

Різниця з класичним speech-to-text простіше за все видно на прикладі. Ви диктуєте: «давай зустрінемось у вівторок… ееее, ні, у середу, бо у вівторок я на зустрічі». Старий движок запише це слово в слово, разом з «ееее» і обома днями. Gemini 3.5 Transcribe розуміє, що «ні, у середу» скасовує попереднє, і віддає нормальне речення: «Давай зустрінемось у середу».

Під капотом там три речі, які працюють разом:

  • Прибирання слів-паразитів. «Емм», «ааа», «ну», кашель посеред фрази — усе це просто не потрапляє в підсумковий текст.
  • Обробка самовиправлень. Модель відстежує, коли людина передумала посеред речення, і лишає тільки фінальну версію думки.
  • Автоматичне форматування. Розділові знаки, великі літери, абзаци, списки — модель розставляє їх сама, без окремого етапу «причісування».

Плюс автовизначення мови: не треба заздалегідь казати системі, що зараз буде іспанська. Модель заявлена як така, що працює з понад 85 мовами й уміє в code-switching — коли людина посеред речення перескакує з однієї мови на іншу.

Скільки помилок насправді: 2,6% і чому цифра не така проста

Google називає Gemini 3.5 Transcribe своєю найточнішою моделлю розпізнавання мовлення. Конкретні цифри такі:

Режим Word Error Rate (загальний) Word Error Rate (бенчмарк FLEURS)
Обробка готового файлу 2,6% 5,04%
Потокова транскрипція в реальному часі 4,0% 5,50%

Word Error Rate, або WER, — це частка слів, які модель почула неправильно. 2,6% означає приблизно одне помилкове слово на кожні сорок. Для порівняння: людина-транскрибатор на чистому записі дає близько 4%, тож заявка серйозна.

Але зверніть увагу на другу колонку. FLEURS — це багатомовний бенчмарк, де мов багато, а записи різні за якістю, і там похибка вже вдвічі більша. Це нормальна ситуація для будь-якої моделі, просто варто розуміти: 2,6% — це не та цифра, яку ви побачите на записі наради з поганим мікрофоном і трьома людьми, що перебивають одне одного.

Друга заявлена цифра — швидкість. Google каже про на 70% швидший час до фінальної транскрипції порівняно з попередньою моделлю Chirp 3. Для диктування це відчувається як «текст з’являється майже одразу», а не «через секунду після того, як ви замовкли».

Ще одна деталь, про яку варто сказати чесно: у матеріалах запуску немає прямого порівняння з Whisper від OpenAI чи іншими конкурентами. Усі цифри — це вимірювання Google на бенчмарках Google. Якщо вам треба ухвалити рішення для продукту, найнадійніший шлях — прогнати через API свої власні записи й порівняти самому.

Де це вже працює: Gboard, Gemini на macOS і Chrome на черзі

Найцікавіше, що модель поїхала не тільки в API для розробників, а одразу в продукти, якими користуються звичайні люди.

  • Gboard Rambler на Android. Це режим клавіатури Google, де ви просто говорите вголос — довго, плутано, з паузами, — а на екрані з’являється чистий відформатований текст. Назва Rambler («той, хто розводить теревені») тут абсолютно буквальна: сенс саме в тому, щоб дозволити людині говорити безладно.
  • Застосунок Gemini на macOS. Той самий механізм диктування на комп’ютері.
  • Chrome — наступний на черзі. Google обіцяє диктування голосом у будь-яке текстове поле браузера: відповісти на лист, накидати пост, поставити запит до Джеміні. Конкретної дати немає, формулювання — «coming next».
  • Корпоративний контур. Модель доступна в Gemini Enterprise Agent Platform, а для сервісів підтримки клієнтів обіцяна «незабаром».

Окремо Google перерахувала партнерів, які вже підключили модель через Live API: LiveKit, Pipecat, Vercel, LangChain, Agora, Fishjam і Vision Agents. Це майже повний список того, на чому сьогодні будують голосових ботів, тож модель, найімовірніше, доїде до вас не через Google, а через сервіс, яким ви вже користуєтесь.

Що дає розробникам: дві моделі, ліміти й нюанси

Модель існує у двох варіантах, і плутати їх не варто — у них різні можливості й різна ціна.

Параметр gemini-3.5-transcribe (файл) gemini-3.5-transcribe-live (потік)
Максимальна довжина до 1 години на запит 10 хвилин на сесію
Розділення дикторів так, до 8 голосів ні
Таймкоди по словах так ні
Власний словник так, до 1000 термінів так
Прибирання слів-паразитів так так

Три речі, на які варто звернути увагу перед тим, як щось на цьому будувати.

Розділення дикторів має підводний камінь. Формально модель тримає до восьми голосів, але Google прямо пише: коректна атрибуція реплік для трьох і більше учасників — експериментальна. Тобто діалог двох людей вона розкладе надійно, а нараду на шістьох — як пощастить.

Таймкоди по словах псують точність. Це не побічний ефект, а зафіксоване в документації обмеження: щойно вмикаєте word-level timestamps, якість транскрипції просідає. І ліміт файлу падає з години до 30 хвилин — так само, як при вмиканні розділення дикторів.

Власний словник — недооцінена штука. Туди можна закинути до тисячі термінів: назви препаратів, прізвища, внутрішній жаргон компанії, специфічні написання. Google при цьому радить не набивати ліміт під зав’язку — оптимально працює приблизно сотня термінів. Якщо ви колись мучились із тим, що система вперто пише «Гончаренко» замість «Гончаров», це рішення саме для такого випадку.

І ще один момент, де джерела між собою не сходяться. В офіційному блозі Google згадує, що модель уміє делегувати задачі іншим моделям Gemini через виклик функцій — наприклад, попросити згенерувати картинку. А в довідці Gemini API таблиця можливостей позначає function calling як такий, що не підтримується, разом із кешуванням, виконанням коду, пошуком по файлах і режимом «думання». Схоже, у публічному прев’ю це працює не скрізь однаково. Якщо ви розраховуєте саме на цю поведінку — закладайте час на перевірку, а не на віру в прес-реліз.

Скільки коштує

Ціни Google дає у двох виглядах — за мільйон токенів і за хвилину. Друге для транскрипції зрозуміліше.

Модель Вхід (аудіо) Вихід (текст) Виходить за годину аудіо
gemini-3.5-transcribe $0,003 / хв $0,002 / хв близько $0,30
gemini-3.5-transcribe-live $0,005 / хв $0,004 / хв близько $0,54

Тридцять центів за годину розшифрованого аудіо — це та цифра, яку варто запам’ятати. Двогодинний подкаст обійдеться приблизно в шістдесят центів. Архів зі ста годин записаних нарад — близько тридцяти доларів. Для порівняння: жива людина за годину транскрипції візьме від двадцяти доларів і вище.

Обидві моделі мають безкоштовний рівень із лімітами — тобто спробувати можна взагалі без карти, через Google AI Studio.

Чи є українська серед 85 мов

Тут доводиться відповідати обережно. Повного переліку 85 мов Google не опублікувала — ні в блозі, ні в документації API. У прикладах згадані англійська, іспанська, французька, турецька, китайська та японська, української серед названих прикладів немає.

Що ми знаємо напевно: українську підтримує сама екосистема Джеміні, і голосове введення Gboard українською працює давно. Плюс FLEURS, бенчмарк, на якому Google міряла похибку, — багатомовний і українську включає. Тож ймовірність, що українська в цих 85+ мовах є, висока, але офіційного підтвердження саме для Gemini 3.5 Transcribe поки що немає.

Практична порада: не вгадуйте, а перевірте. Модель у безкоштовному рівні доступна через Google AI Studio — залийте хвилину власного українського аудіо й подивіться на результат. Це займе менше часу, ніж пошук офіційного списку мов. До речі, якщо ви студент, у вас може вже бути розширений доступ до інструментів Google — про це ми писали в матеріалі про безкоштовний рік Google AI Plus для студентів в Україні.

Кому це реально знадобиться

Найочевидніший сценарій — той, про який Google говорить найменше: субтитри. Точні таймкоди по словах плюс розділення дикторів — це рівно те, що потрібно, щоб зробити субтитри до відео без ручного вирівнювання. Якщо ви ріжете короткі вертикальні ролики, це закриває найнуднішу частину роботи — ми розбирали цей процес у гайді про монтаж коротких відео для Shorts.

Другий сценарій — наради й інтерв’ю. Година запису за тридцять центів із розділенням на голоси й уже причесаним текстом означає, що розшифровувати вручну більше немає сенсу ні за яких умов.

Третій — голосові інтерфейси. Саме під них модель і робилась: затримка на 70% менша, потоковий режим, партнерство з платформами для голосових агентів. Якщо ви колись розмовляли з ботом підтримки й хотіли його придушити за фразу «вибачте, я вас не зрозумів» — саме цю проблему тут і намагаються полагодити.

І четвертий, найбуденніший — просто диктування. Той випадок, коли ви йдете вулицею, надиктовуєте думку в телефон і отримуєте текст, який не соромно надіслати без правок. До цього моменту голосове введення завжди вимагало «ще трохи причесати». Зараз Google каже, що не вимагає.

Чи так це насправді — з’ясується, коли модель вийде з прев’ю і на неї подивиться не тільки маркетинговий відділ. Але напрямок правильний: розпізнавання мови нарешті перестає бути стенографією і стає перекладом з усного в письмове. А це, якщо чесно, дві дуже різні задачі — і другу досі ніхто нормально не вирішив. Якщо ви порівнюєте інструменти між собою, почитайте також наш гайд про ChatGPT простими словами — там про те, як влаштований головний конкурент Google у цій гонці.

Підпишіться на новини про штучний інтелект!

Ви будете отримувати від нас листи раз на тиждень.

Політика конфіденційності

Залишити коментар

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *

Прокрутка до верху