Роботы по-прежнему сталкиваются с трудностями при выполнении задач, которые кажутся людьми достаточно простыми. Основная проблема заключается в том, что недостаточно просто понять задание, необходимо также точно привязать каждое действие к предмету и месту в пространстве. Команда Microsoft и группы исследователей из университетов представила новый тест GroundedPlanBench, который проверяет, может ли модель строить план действий и при этом точно связывать каждый шаг с объектом на изображении.
Обычно процесс включает два отдельных этапа: первая модель формирует словесный план, а затем другая пытается преобразовать его в реальные действия робототехники. Эта раздельность часто приводит к ошибкам, таким как неправильный выбор предмета или выполнение лишних действий. Такие сбои наиболее заметны в сложных или загроможденных условиях.
В новом тесте важным параметром является жесткая привязка действий к конкретным объектам. Каждое действие должно сопровождаться указанием предмета, к которому оно относится. Это позволяет модели учитывать физическую обстановку.
Тест включает более 1000 заданий, основанных на реальных взаимодействиях роботов с объектами. Исследование показало, что размытые формулировки могут создавать дополнительные трудности, особенно в ситуациях с похожими предметами.
Чтобы улучшить обучение моделей, команда предложила метод Video-to-Spatially Grounded Planning (V2GP), позволяющий системам учиться на видео реальных взаимодействий. Это приводит к созданию более точных планов с четкой пространственной привязкой.
Несмотря на успехи, задачи остаются сложными, особенно когда инструкции сформулированы неясно. Команда также рассматривает возможность объединения новых методов с предсказательными моделями, что может в будущем улучшить эффективность роботов в выполнении заданий.