Google DeepMind наделила гуманоидных роботов способностью координировать движения всего тела
Компания Google DeepMind представила новое поколение ИИ-моделей, которые впервые позволяют управлять человекоподобным роботом как единым целым — от ног и рук до кистей и пальцев. Система преобразует голосовые команды и визуальную информацию в комплексные действия и способна самостоятельно адаптироваться к незнакомым ситуациям.
В основе разработки лежат три взаимосвязанные модели. Первая — Gemini Robotics 2 — относится к классу «зрение — язык — действие» и переводит изображение с камер и текстовые инструкции в движения. Вторая — Gemini Robotics ER 2 — выполняет роль планировщика: она анализирует обстановку, выстраивает последовательность шагов и позволяет роботу исправлять ошибки без вмешательства человека. Третья — Gemini Robotics On-Device 2 — работает прямо на борту робота и способна за несколько часов адаптировать управление под новую платформу.
Разработчики продемонстрировали возможности системы на гуманоидном роботе Apollo компании Apptronik. Получив голосовую команду «поставь лейку в зелёный контейнер на нижней полке», Apollo самостоятельно подошёл к столу, взял лейку, проследовал к стеллажу и разместил предмет в указанном месте. В других тестах робот приседал, чтобы поднять лейку с пола, выбирал нужные предметы на полках, а также выполнял тонкие манипуляции: завязывал узел, застёгивал молнию, герметично закрывал пакет и выкручивал электролампочку. Эти же модели успешно протестировали на двухманипуляторной системе при сортировке инструментов.
«Впервые одна система способна преобразовывать намерения и команды человека в комплексные движения всего тела», — отмечают в Google DeepMind. Разработчики признают, что роботам ещё предстоит нарастить скорость, но уже сейчас достигнут значительный прогресс в согласованной работе всех частей корпуса.