Gemini Robotics 2: як Google навчає роботів діяти

Інженер керує командою з двох роботів

Google навчила роботів не лише рухати руками, а планувати роботу всім тілом, помічати власні помилки й передавати частину задачі іншій машині. 30 липня 2026 року DeepMind представила Gemini Robotics 2 — сімейство моделей для гуманоїдів, дворуких роботів і локальних роботизованих систем.

Назва звучить так, ніби завтра робот уже складатиме речі у вашій шафі. Насправді реліз складається з трьох різних рівнів, і лише один із них доступний широкому колу розробників. Розділимо демонстрацію, реальну модель і те, що поки залишилося для партнерів.

Що таке Gemini Robotics 2

Роботи з моделлю Gemini Robotics 2 виконують фізичні задачі
Заголовок Gemini Robotics 2 — офіційна ілюстрація
Опис Офіційна ілюстрація Google DeepMind до анонсу Gemini Robotics 2.
Alt Роботи з моделлю Gemini Robotics 2 виконують фізичні задачі

Gemini Robotics 2 — не один робот і не готовий домашній помічник. Це набір моделей, які відповідають за різні частини роботи фізичного агента: розуміння простору, планування кроків і перетворення команди на рухи.

У звичайного чат-бота помилка закінчується невдалим абзацом. У робота неправильне рішення може означати розлиту воду, пошкоджену річ або небезпечний рух поруч із людиною. Тому Google розділяє високорівневе міркування та низькорівневе керування механікою.

Модель Що робить Доступ
Gemini Robotics 2 Перетворює зір і мовну команду на рухи тіла та маніпуляторів Early access для партнерів
Gemini Robotics ER 2 Розуміє сцену, планує довгі задачі й керує інструментами Preview у Gemini API та Google AI Studio
Gemini Robotics On-Device 2 Працює локально без постійного підключення до хмари Early access для партнерів

Як три моделі керують одним роботом

ER 2 працює як високорівневий мозок

Gemini Robotics ER 2 отримує текст, зображення, аудіо або відео. Вона аналізує простір, розбиває команду на кроки й викликає доступні інструменти. Таким інструментом може бути навігація, захват предмета, пошук інформації або окрема модель руху.

Наприклад, команда «поклади лійку в зелену коробку на нижній полиці» містить кілька задач. Треба знайти лійку, оцінити шлях, підійти, схопити предмет, не втратити його, знайти потрібну полицю й перевірити результат. ER 2 тримає загальний план, а рухова модель виконує конкретні дії.

VLA перетворює намір на рух

Основна Gemini Robotics 2 належить до класу vision-language-action. Вона бачить сцену, розуміє мовну інструкцію і генерує керування для механіки. Google показує її на гуманоїді Apollo 2 та дворукій платформі Franka Duo.

Модель керує ходьбою, нахилами, роботою двох рук і точними захватами. Проте результати ще нерівні. У тестах Google робот добре виконує частину завдань із двопальцевими захватами, але складна робота п’ятьма пальцями лишається проблемою: для окремих дій успішність була нижчою за половину спроб.

On-Device 2 прибирає залежність від мережі

Для виробництва або складу затримка хмари може бути неприйнятною. Gemini Robotics On-Device 2 працює локально на обладнанні робота. Це дає швидшу реакцію й дозволяє виконувати частину задач без інтернету.

За даними Google, модель можна адаптувати до нового дворукого робота за кілька годин, часто використовуючи менш ніж 200 прикладів. Це не означає, що будь-яка машина одразу стане універсальною. Потрібні сумісні сенсори, контролери, навчальні дані та фізичні обмеження.

Як роботи відстежують прогрес і виправляють помилки

Одна з найцікавіших функцій ER 2 — розуміння прогресу за безперервним відео. Модель оцінює, наскільки виконано задачу, знаходить момент ключової події й вирішує, чи переходити до наступного кроку.

У тесті на класифікацію прогресу Google повідомляє 57,4% точності. Для пошуку точного моменту події — 91,3% і середнє відхилення 0,96 секунди. Це дані самої компанії, а не незалежний аудит, але вони показують, що головна ціль релізу — не красиві рухи, а контроль довгих послідовностей.

Якщо робот не закрутив лампочку або предмет вислизнув із захвату, система може побачити невдачу й повторити крок, а не продовжувати план так, наче все добре. Саме така перевірка відрізняє фізичного агента від заздалегідь записаної демонстрації.

Як працює команда з кількох роботів

Gemini Robotics 2 дозволяє різним машинам координувати спільну задачу. Колісний робот може швидко пересуватися рівною підлогою, гуманоїд — діставати предмети з полиць, а стаціонарний маніпулятор — точно пакувати їх. Замість вимагати все від однієї дорогої конструкції, система розподіляє ролі.

Для українського бізнесу найближчий сценарій — не гуманоїд у квартирі, а склад, лабораторія або виробнича ділянка. Кілька спеціалізованих машин можуть обмінюватися станом задачі через спільну модель планування.

Як виглядають спроби зробити саме домашнього гуманоїда, можна прочитати в матеріалі про NEO Gamma. Gemini Robotics 2 цікава іншим: Google будує програмний інтелект, який потенційно можна адаптувати до різних корпусів.

Доступність і вартість Gemini Robotics 2

Gemini Robotics ER 2 доступна як preview у Google AI Studio та через Gemini API. Розробник може передавати текст, зображення, відео й аудіо, отримувати текстовий план, викликати функції, виконувати код і працювати зі структурованими відповідями. Контекст становить до 131 072 вхідних токенів, вихід — до 65 536.

Потокова версія ER 2 підтримує Live API і функціональні виклики у реальному часі. Водночас повна VLA-модель керування тілом і On-Device 2 доступні лише партнерам раннього тестування. Без робота та інтеграції API не перетворить ноутбук на механічного помічника.

Окремої публічної ціни ER 2 на картці моделі під час перевірки немає. Preview може мати спеціальні умови й ліміти, тому перед розробкою треба дивитися фактичні дані в Google AI Studio або консолі проєкту. Вартість самого API — лише невелика частина бюджету поруч із робототехнікою, сенсорами, безпекою та тестуванням.

Для порівняння з доступнішими агентними моделями Google є наш огляд Gemini 3.6 Flash і 3.5 Flash-Lite. Вони не керують тілом робота, але краще підходять для звичайних програмних агентів.

Як почати тестування без дорогого гуманоїда

  1. Відкрити Gemini Robotics ER 2 у Google AI Studio й перевірити, чи модель доступна для вашого акаунта.
  2. Почати з відео записаного процесу: сортування предметів, складання набору або перевірки приладу.
  3. Попросити модель визначати етапи, помилки й момент завершення кожного кроку.
  4. Замінити фізичні дії безпечними функціями в симуляторі.
  5. Додати реальне обладнання лише після журналювання, обмежень швидкості та аварійної зупинки.

Google окремо тестує дотримання обмежень і зупинку робота, коли поруч з’являється людина. Та ці оцінки не замінюють сертифікацію конкретної машини. Модель бачить світ через сенсори, які теж можуть помилятися, а фізична безпека має залишатися на рівні контролерів і механіки.

Gemini Robotics 2 показує, куди рухаються агенти: від кліків у браузері до дій у просторі. Але найкорисніша частина релізу сьогодні — ER 2 для аналізу відео, планування й оркестрації. Гуманоїд, який без нагляду прибирає квартиру, поки залишається хорошою демонстрацією, а не товаром із кнопкою «Купити».

Джерела

Підпишіться на новини про штучний інтелект!

Ви будете отримувати від нас листи раз на тиждень.
Політика конфіденційності

Залишити коментар

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *

Прокрутка до верху