Роботу показали человеческое видео — и он научился выполнять незнакомую задачу без дообучения
Вчера на arXiv появилась работа Zero-WAM (название исследовательского метода для обучения роботов по видео с действиями человека), которая предлагает довольно естественный способ объяснять роботу новое действие: не писать инструкцию и не собирать отдельный набор роботизированных демонстраций, а просто показать видео, где человек выполняет нужную задачу.Модель анализирует, как развивается сцена на видео, и использует это как контекст для собственных действий.
Авторы собрали набор из 74,2 тысячи пар человеческих и роботизированных демонстраций для 8,6 тысячи задач, после чего проверили систему на операциях, которых она раньше не видела.В симуляторе RoboTwin 2.0 на семи новых задачах средняя успешность составила 47% — на 29,5 процентного пункта выше сильнейшей сравниваемой модели.
habr.com