Новые подходы Microsoft к обучению роботов

Роботы всё ещё сталкиваются с задачами, которые кажутся понятными людям. Проблема заключается не только в том, чтобы понять команду, но и в корректной привязке действий к объектам в пространстве. Microsoft в сотрудничестве с исследователями из университетов представила тест под названием GroundedPlanBench, который проверяет способность моделей одновременно создавать план действий и точно связывать каждый шаг с конкретным объектом на изображении.

Процесс обычно делится на два этапа: первый создает словесный план, второй переводит его в физические действия. Часто это приводит к ошибкам: robot может выбрать неправильный предмет или выполнить лишние действия. Особенно это заметно в сложных сценах с множеством объектов.

Тест требует от модели не только правильной последовательности действий, но и жесткой привязки к конкретным объектам. Более 1000 заданий включают как простые, так и сложные инструкции, позволяя выявить, насколько машинное понимание отличается от человеческого.

Например, при команде положить 4 салфетки на диван, робот постоянно выбирал одну и ту же из-за недостатка четких указаний. Исследователи указали, что недостаточная определенность в заданиях приводит к ошибкам.

Для улучшения ситуации команда разработала метод Video-to-Spatially Grounded Planning (V2GP), который обучает систему на видео с выполнением реальных задач. Это позволяет создать более структурированные планы, где каждое действие связано с конкретной позицией объектов.

Сбор данных превысил 40 тысяч планов, что улучшило выбор правильных действий и уменьшило количество повторяющихся ошибок. Однако, сложные задачи с косвенными инструкциями по-прежнему представляют собой вызов для текущих систем. Исследования будут продолжены, чтобы связать новые подходы с предсказательными моделями, позволяя роботам предугадывать ошибки прежде, чем они произойдут.

Понравилась статья? Поделиться с друзьями:
Сайт для студентов