Голосовий ШІ в інтернет-магазині часто виглядає як дорога демонстрація, яку ніхто не просив. Японська avatarin перевірила інший підхід: її агент на GPT‑Realtime не просто відповідав на запитання, а розпитував покупця про потреби й допомагав вибрати товар.
За два тижні публічної кампанії на сайті Yamada Denki агентом скористалися приблизно 30 000 людей. За даними OpenAI, 92% відповідей у короткому опитуванні після розмови були позитивними. Це ще не доказ зростання продажів, але вже достатньо конкретний кейс, щоб розібрати його без магічного слова «революція».
Що побудували avatarin і Yamada Denki

avatarin — компанія з розробки ШІ-сервісів підтримки, яка виросла з ANA Holdings. Разом із японським ритейлером Yamada Holdings вона створила Kurashi-Marugoto AI Agent — цілодобового мультимовного консультанта для магазину побутової техніки.
Агент спілкується голосом і текстом, допомагає перейти від загальної потреби до конкретного товару та працює після закриття звичайних магазинів. Наприклад, покупець може сказати: «Потрібен холодильник для сім’ї з чотирьох людей, але кухня маленька». Система має не видати випадковий список, а уточнити розміри, бюджет і пріоритети.
Як працює голосовий продавець на GPT‑Realtime
Одна модель працює з голосом, текстом і зображеннями
GPT‑Realtime приймає аудіо й текст та відповідає майже без пауз, характерних для старого ланцюжка «розпізнати голос — написати відповідь — озвучити текст». Модель також може отримувати зображення, тому голосову розмову можна доповнити фото товару або простору.
Базово технологія доступна розробникам через WebRTC, WebSocket і SIP. Детальніше про саму модель ми писали в матеріалі про GPT‑Realtime для бізнесу. Новий кейс avatarin цікавий не релізом API, а тим, як його приземлили на реальний каталог магазину.
RAG тримає відповіді в межах каталогу
Вільна голосова розмова небезпечна для магазину, якщо модель починає вигадувати характеристики. Тому avatarin використала RAG — пошук релевантних даних у базі товарів перед формуванням відповіді.
Модель веде діалог природно, а факти про розміри, функції та сумісність бере з підготовленого джерела. Це не робить помилку неможливою, але значно зменшує ризик, якщо каталог актуальний, а система відмовляється відповідати поза знайденими даними.
Агент ставить запитання, а не чекає ключового слова
Звичайний бот часто нагадує пошук із кнопками: він чекає правильно сформульованого запиту. Агент avatarin сам уточнює потреби. Для холодильника важливі кількість людей, доступний простір, бюджет і набір функцій; для пральної машини список запитань буде іншим.
Команда перенесла знання продавців Yamada Denki у сценарії розмови та промпти. Водночас діалог не зафіксований жорстко: якщо людина змінює вимогу або тимчасово відходить від теми, агент має повернутися до вибору без повного перезапуску.
Які результати отримав магазин
- приблизно 30 000 користувачів за два тижні;
- підтримка голосом і текстом 24/7;
- 92% позитивних відповідей у післясервісному опитуванні.
Ці цифри опублікувала OpenAI у клієнтському кейсі, тому їх слід сприймати саме як дані компаній-учасників. У матеріалі немає конверсії в покупку, середнього чека чи порівняння з контрольною групою. Отже, говорити, що агент «збільшив продажі на X%», не можна.
Натомість є інший корисний результат: магазин отримує дані про те, що хвилює покупців, де вони сумніваються й чому відкладають рішення. У звичайному каталозі видно кліки, але не завжди видно мотив. У розмові цей мотив часто звучить прямо.
Скільки коштує GPT‑Realtime
OpenAI рахує використання базової моделі GPT‑Realtime за токенами. На момент перевірки текстовий вхід коштує 4 долари за мільйон токенів, кешований вхід — 0,40 долара, текстовий вихід — 16 доларів.
Для аудіо ціна вища: 32 долари за мільйон вхідних аудіотокенів і 64 долари за мільйон вихідних. Безкоштовний API-рівень для цієї моделі не підтримується.
| Тип даних | Вхід за 1 млн токенів | Вихід за 1 млн токенів |
|---|---|---|
| Текст | $4 | $16 |
| Аудіо | $32 | $64 |
| Зображення | $5 | Не підтримується |
Перетворити аудіотокени на точну ціну хвилини без реального профілю розмови складно: витрати залежать від того, скільки говорить клієнт, наскільки довгі відповіді агента, що кешується і які додаткові інструменти викликаються.
API — лише частина бюджету. Потрібні телефонія або вебаудіо, сервер, каталог для RAG, аналітика, журнал розмов, моніторинг якості та розробка інтеграцій. Для пілота варто рахувати повну вартість однієї завершеної консультації, а не лише ціну моделі.
Що може повторити український інтернет-магазин
Не обов’язково починати з усього каталогу та телефонної лінії. Безпечніший пілот — одна товарна категорія на сайті, де покупці часто ставлять однакові, але контекстні запитання.
- Виберіть вузьку задачу. Наприклад, підбір зарядної станції, ноутбука або побутової техніки.
- Підготуйте перевірене джерело даних. Характеристики, залишки, гарантія, доставка й правила повернення мають оновлюватися автоматично.
- Запишіть логіку консультації. Які питання ставить сильний продавець і в якому порядку.
- Додайте межі. Агент не вигадує знижки, не обіцяє наявність без перевірки й передає людині нестандартні випадки.
- Тестуйте на сайті. Вебвіджет дешевше й простіше контролювати, ніж одразу підключати телефонію.
- Вимірюйте результат. Завершені консультації, переходи до товару, звернення до оператора, помилки та оцінка користувача.
Коли голос кращий за звичайний чат
Голос має сенс, коли клієнтові незручно друкувати, питання містить багато деталей або вибір потребує кількох уточнень. Це працює для складної техніки, туристичних послуг, запису на сервіс чи первинної кваліфікації звернення.
Для перевірки статусу замовлення або одного короткого питання текстовий бот часто дешевший і тихіший. Не кожен відвідувач хоче говорити з сайтом уголос. Тому хороший інтерфейс залишає вибір між текстом і голосом, як це зробила avatarin.
Голосовий режим у самому ChatGPT розвивається окремо; про нього можна прочитати в огляді GPT‑Live. Для магазину потрібен саме API, бо він дозволяє підключити каталог, інструменти й бізнес-правила.
Які ризики треба закрити до запуску
- Вигадані характеристики. Відповіді мають спиратися на каталог і містити відмову, якщо даних немає.
- Застаріла наявність. Залишки та ціни потрібно отримувати з актуальної системи, а не з файлу місячної давнини.
- Персональні дані. Покупець має розуміти, що розмовляє з ШІ, які дані записуються і навіщо.
- Невдале розпізнавання. Адреси, артикули й номери треба повторювати для підтвердження.
- Відсутність людини. Агент повинен передавати складний випадок оператору разом із коротким контекстом розмови.
Окремо варто тестувати українську мову, змішані українсько-англійські назви моделей і шумне оточення. Те, що голос звучить природно в демонстрації, ще не означає, що він правильно почує артикул під час дзвінка з вулиці.
Чого насправді навчає кейс avatarin
Сильна частина проєкту — не голос OpenAI сам по собі. Команда поєднала модель із перевіреним каталогом, знаннями продавців, уточнювальними питаннями та обмеженнями. Без цих складових GPT‑Realtime був би лише приємним співрозмовником, який не знає, що є на складі.
Для українського бізнесу висновок прагматичний: починайте не з «хочемо голосового ШІ», а з конкретної консультації, яку зараз дорого або повільно обробляє людина. Побудуйте вузький пілот, порахуйте вартість завершеної розмови й лише після цього масштабуйте на телефон, інші категорії та цілодобову роботу.
Джерела
- OpenAI: How avatarin built a 24/7 retail agent with GPT‑Realtime
- OpenAI API: GPT‑Realtime — можливості та ціни


