MobilePA-Bench: бенчмаркинг мобильных планировщиков-агентов на сложных реальных задачах

исследования офиц. + СМИ 2 ист. ~1 мин

Интерактивный, stateful, tool-centric бенчмарк для мобильных планировщиков-агентов, закрывающий разрыв между GUI-centric бенчмарками (поверхностное манипулирование экраном) и статическими function-calling бенчмарками (оффлайн-API-мэтчинг). Охватывает 13 функциональных доменов и 212 реалистичных мобильных инструментов, работающих в исполняемой песочнице с живыми базами данных и структурированной обратной связью. Оценивает три продвинутых измерения: коллаборацию sub-агентов, использование памяти и использование навыков. Обширные эксперименты показывают, что современные frontier-LLM остаются ненадёжными в мобильных сценариях — производительность резко падает при строгом порядке вызова инструментов, лимитах разрешений и неожиданных рантайм-ошибках.

Почему это важно

HF Daily 36 апвоутов 25 августа. Выступает одновременно как диагностическим бенчмарком и интерактивным фундаментом для агентского RL на мобильных устройствах; 212 инструментов через 13 доменов — самая широкая публичная поверхность оценки мобильных агентов на сегодня.

Важность: 3/5

HF Daily 36 апвоутов

Источники

официальный arXiv abstract