Розумному колісному кріслу недостатньо просто помітити щось попереду. Йому потрібно відрізнити бордюр від сумки, людину від дверей і зрозуміти, де саме закінчується перешкода. У проєкті RAMMP це завдання доручили моделям комп’ютерного зору Meta — DINOv3 і Segment Anything Model.
Йдеться не про готовий товар із ціною та кнопкою «Купити». Університет Піттсбурга разом із партнерами створює дослідницьку роботизовану платформу мобільності, яка має допомагати людині з інвалідністю пересуватися, знаходити предмети й керувати маніпулятором.
Що таке роботизована платформа RAMMP
RAMMP розшифровується як Robotic Assistive Mobility and Manipulation Platform Providing Independence for People with Disabilities. Проєкт веде Human Engineering Research Laboratories Університету Піттсбурга разом з ATDev та іншими партнерами.
Ініціатива отримала підтримку американського агентства ARPA-H. За даними Meta, можливе фінансування сягає 41,5 мільйона доларів. Це бюджет дослідницької програми, а не ціна майбутнього крісла.
До роботи залучають користувачів колісних крісел, клініцистів і правозахисні організації. Такий підхід важливий: інженерна система може блискуче проходити лабораторний тест і водночас дратувати людину в кожній побутовій дії.
Навіщо колісному кріслу моделі комп’ютерного зору
Камера дає потік зображень, але сама по собі не пояснює, що на них відбувається. ШІ перетворює кадри на структуроване уявлення про простір: визначає предмети, відокремлює їх від фону й допомагає оцінити розташування.
Це потрібно не лише для об’їзду перешкод. Платформа має бачити потрібний предмет, під’їжджати до нього та допомагати роботизованому маніпулятору захопити саме те, що вибрала людина.
Як DINOv3 розуміє сцену навколо користувача

| Заголовок | Платформа RAMMP з моделями Meta DINOv3 і SAM |
|---|---|
| Опис | Офіційне зображення дослідницької платформи RAMMP, яка використовує моделі комп’ютерного зору Meta. |
| Alt | Дослідницька платформа RAMMP для допоміжної робототехніки |
DINOv3 — модель комп’ютерного зору із самонавчанням. Вона вчиться знаходити закономірності у великій кількості зображень без ручного підпису кожного об’єкта.
Для реального світу це корисно, бо неможливо заздалегідь розмітити кожну сумку, тріщину, тінь і відблиск. DINOv3 формує візуальні ознаки високої роздільності, які можна використати для класифікації, семантичної сегментації та відстеження об’єктів у відео.
Якщо перекласти на людську мову, DINOv3 допомагає системі зрозуміти загальну сцену й знайти ділянки, на які варто звернути увагу.
Як SAM проводить межі предметів і перешкод
Segment Anything Model, або SAM, займається сегментацією. Вона не просто повідомляє, що в кадрі є предмет, а визначає, які пікселі належать йому.
Точні межі потрібні, щоб оцінити форму, розмір і положення об’єкта. У парі DINOv3 дає загальне розуміння сцени, а SAM допомагає виділити конкретний предмет, до якого потрібно під’їхати або який має взяти маніпулятор.
Meta описує ці моделі як основу «зору» платформи RAMMP: вони допомагають навігації, розумінню сцени та вибору правильного об’єкта.
Чому моделі мають працювати прямо на пристрої
Дослідники запускають DINOv3 і SAM локально, без постійного надсилання відео в хмару. Для допоміжної робототехніки це не технічна прикраса, а вимога до надійності.
Якщо на шляху раптово з’являється перешкода, система не може чекати відповіді сервера. Вона має працювати в ліфті, коридорі, на вулиці й у місці зі слабким зв’язком.
Локальна обробка також зменшує потребу передавати відео назовні. Це може покращити приватність, хоча остаточний рівень захисту залежатиме від архітектури готового пристрою.
Які технічні проблеми ще потрібно розв’язати
- Енергоспоживання. Великі моделі не повинні швидко розряджати батарею.
- Затримка. Точна відповідь марна, якщо система отримує її запізно.
- Нагрівання. Обчислювальний модуль не має робити пристрій важким або шумним.
- Непередбачувані умови. Сонце, дощ, дзеркала, темні коридори й рухомі люди змінюють картинку.
- Людський контроль. Користувач повинен розуміти дії системи та мати змогу зупинити її.
Саме тому команда використовує цифровий двійник — віртуальну копію платформи й середовища. У симуляції можна багато разів повторити небезпечний сценарій без ризику для людини. Але симуляція не замінює реальні випробування: вона не знає всіх тріщин, відблисків і дивних предметів, які люди залишають посеред проходу.
Коли розумне колісне крісло RAMMP стане доступним
Meta й Університет Піттсбурга не назвали дату виходу комерційного пристрою та не оголосили ціну. RAMMP залишається дослідницькою платформою, а не моделлю крісла, яку можна замовити сьогодні.
Перед виходом на ринок система має пройти випробування безпеки й регуляторні процедури. Термін залежатиме не лише від точності моделей, а й від батареї, апаратної частини, надійності та реального досвіду користувачів.
Чому проєкт RAMMP важливий для допоміжних технологій
DINOv3 і SAM створювалися як універсальні моделі комп’ютерного зору. RAMMP показує, як їх можна пристосувати до конкретного завдання, де помилка має фізичні наслідки й не виправляється кнопкою «згенерувати ще раз».
Якщо розробникам вдасться знайти баланс між точністю, швидкістю та автономністю, ці підходи можуть бути корисними не лише для колісних крісел. Вони можуть перейти в протези, роботизовані маніпулятори й навігаційні помічники.
Більше про практичні застосування комп’ютерного зору можна прочитати в матеріалах про новини зі світу ШІ та огляди ШІ-сервісів.
Офіційні джерела: Meta про RAMMP, Meta про DINOv3.


