Google навчила роботів не лише рухати руками, а планувати роботу всім тілом, помічати власні помилки й передавати частину задачі іншій машині. 30 липня 2026 року DeepMind представила Gemini Robotics 2 — сімейство моделей для гуманоїдів, дворуких роботів і локальних роботизованих систем.
Назва звучить так, ніби завтра робот уже складатиме речі у вашій шафі. Насправді реліз складається з трьох різних рівнів, і лише один із них доступний широкому колу розробників. Розділимо демонстрацію, реальну модель і те, що поки залишилося для партнерів.
Що таке Gemini Robotics 2

| Заголовок | Gemini Robotics 2 — офіційна ілюстрація |
|---|---|
| Опис | Офіційна ілюстрація Google DeepMind до анонсу Gemini Robotics 2. |
| Alt | Роботи з моделлю Gemini Robotics 2 виконують фізичні задачі |
Gemini Robotics 2 — не один робот і не готовий домашній помічник. Це набір моделей, які відповідають за різні частини роботи фізичного агента: розуміння простору, планування кроків і перетворення команди на рухи.
У звичайного чат-бота помилка закінчується невдалим абзацом. У робота неправильне рішення може означати розлиту воду, пошкоджену річ або небезпечний рух поруч із людиною. Тому Google розділяє високорівневе міркування та низькорівневе керування механікою.
| Модель | Що робить | Доступ |
|---|---|---|
| Gemini Robotics 2 | Перетворює зір і мовну команду на рухи тіла та маніпуляторів | Early access для партнерів |
| Gemini Robotics ER 2 | Розуміє сцену, планує довгі задачі й керує інструментами | Preview у Gemini API та Google AI Studio |
| Gemini Robotics On-Device 2 | Працює локально без постійного підключення до хмари | Early access для партнерів |
Як три моделі керують одним роботом
ER 2 працює як високорівневий мозок
Gemini Robotics ER 2 отримує текст, зображення, аудіо або відео. Вона аналізує простір, розбиває команду на кроки й викликає доступні інструменти. Таким інструментом може бути навігація, захват предмета, пошук інформації або окрема модель руху.
Наприклад, команда «поклади лійку в зелену коробку на нижній полиці» містить кілька задач. Треба знайти лійку, оцінити шлях, підійти, схопити предмет, не втратити його, знайти потрібну полицю й перевірити результат. ER 2 тримає загальний план, а рухова модель виконує конкретні дії.
VLA перетворює намір на рух
Основна Gemini Robotics 2 належить до класу vision-language-action. Вона бачить сцену, розуміє мовну інструкцію і генерує керування для механіки. Google показує її на гуманоїді Apollo 2 та дворукій платформі Franka Duo.
Модель керує ходьбою, нахилами, роботою двох рук і точними захватами. Проте результати ще нерівні. У тестах Google робот добре виконує частину завдань із двопальцевими захватами, але складна робота п’ятьма пальцями лишається проблемою: для окремих дій успішність була нижчою за половину спроб.
On-Device 2 прибирає залежність від мережі
Для виробництва або складу затримка хмари може бути неприйнятною. Gemini Robotics On-Device 2 працює локально на обладнанні робота. Це дає швидшу реакцію й дозволяє виконувати частину задач без інтернету.
За даними Google, модель можна адаптувати до нового дворукого робота за кілька годин, часто використовуючи менш ніж 200 прикладів. Це не означає, що будь-яка машина одразу стане універсальною. Потрібні сумісні сенсори, контролери, навчальні дані та фізичні обмеження.
Як роботи відстежують прогрес і виправляють помилки
Одна з найцікавіших функцій ER 2 — розуміння прогресу за безперервним відео. Модель оцінює, наскільки виконано задачу, знаходить момент ключової події й вирішує, чи переходити до наступного кроку.
У тесті на класифікацію прогресу Google повідомляє 57,4% точності. Для пошуку точного моменту події — 91,3% і середнє відхилення 0,96 секунди. Це дані самої компанії, а не незалежний аудит, але вони показують, що головна ціль релізу — не красиві рухи, а контроль довгих послідовностей.
Якщо робот не закрутив лампочку або предмет вислизнув із захвату, система може побачити невдачу й повторити крок, а не продовжувати план так, наче все добре. Саме така перевірка відрізняє фізичного агента від заздалегідь записаної демонстрації.
Як працює команда з кількох роботів
Gemini Robotics 2 дозволяє різним машинам координувати спільну задачу. Колісний робот може швидко пересуватися рівною підлогою, гуманоїд — діставати предмети з полиць, а стаціонарний маніпулятор — точно пакувати їх. Замість вимагати все від однієї дорогої конструкції, система розподіляє ролі.
Для українського бізнесу найближчий сценарій — не гуманоїд у квартирі, а склад, лабораторія або виробнича ділянка. Кілька спеціалізованих машин можуть обмінюватися станом задачі через спільну модель планування.
Як виглядають спроби зробити саме домашнього гуманоїда, можна прочитати в матеріалі про NEO Gamma. Gemini Robotics 2 цікава іншим: Google будує програмний інтелект, який потенційно можна адаптувати до різних корпусів.
Доступність і вартість Gemini Robotics 2
Gemini Robotics ER 2 доступна як preview у Google AI Studio та через Gemini API. Розробник може передавати текст, зображення, відео й аудіо, отримувати текстовий план, викликати функції, виконувати код і працювати зі структурованими відповідями. Контекст становить до 131 072 вхідних токенів, вихід — до 65 536.
Потокова версія ER 2 підтримує Live API і функціональні виклики у реальному часі. Водночас повна VLA-модель керування тілом і On-Device 2 доступні лише партнерам раннього тестування. Без робота та інтеграції API не перетворить ноутбук на механічного помічника.
Окремої публічної ціни ER 2 на картці моделі під час перевірки немає. Preview може мати спеціальні умови й ліміти, тому перед розробкою треба дивитися фактичні дані в Google AI Studio або консолі проєкту. Вартість самого API — лише невелика частина бюджету поруч із робототехнікою, сенсорами, безпекою та тестуванням.
Для порівняння з доступнішими агентними моделями Google є наш огляд Gemini 3.6 Flash і 3.5 Flash-Lite. Вони не керують тілом робота, але краще підходять для звичайних програмних агентів.
Як почати тестування без дорогого гуманоїда
- Відкрити Gemini Robotics ER 2 у Google AI Studio й перевірити, чи модель доступна для вашого акаунта.
- Почати з відео записаного процесу: сортування предметів, складання набору або перевірки приладу.
- Попросити модель визначати етапи, помилки й момент завершення кожного кроку.
- Замінити фізичні дії безпечними функціями в симуляторі.
- Додати реальне обладнання лише після журналювання, обмежень швидкості та аварійної зупинки.
Google окремо тестує дотримання обмежень і зупинку робота, коли поруч з’являється людина. Та ці оцінки не замінюють сертифікацію конкретної машини. Модель бачить світ через сенсори, які теж можуть помилятися, а фізична безпека має залишатися на рівні контролерів і механіки.
Gemini Robotics 2 показує, куди рухаються агенти: від кліків у браузері до дій у просторі. Але найкорисніша частина релізу сьогодні — ER 2 для аналізу відео, планування й оркестрації. Гуманоїд, який без нагляду прибирає квартиру, поки залишається хорошою демонстрацією, а не товаром із кнопкою «Купити».



