OSReward: стандартизированная оценка кросс-платформенных reward-моделей для computer-use

NLP Group of The University of Hong Kong

исследования официальный 1 ист. ~1 мин

Предлагает бенчмарк для оценки траекторий агентов, использующих компьютер, с помощью vision-language моделей, обнаруживает, что даже современные модели демонстрируют систематическую склонность к снисходительности, ошибочно засчитывая провалы как успехи, и публикует датасет OS-Shepherd-100K, а также открытые reward-модели на 9B/35B, сопоставимые с коммерческими аналогами при меньшей стоимости.

Почему это важно

Вторая по популярности статья на HuggingFace Daily Papers за 2026-08-09 с 67 голосами; вскрывает конкретный изъян в оценке, влияющий на то, как в целом по индустрии оцениваются computer-use агенты.

Важность: 3/5

Заметная статья HuggingFace Daily Paper (исследование) — вторая по популярности статья на HuggingFace Daily Papers за 2026-08-09 с 67 голосами; вскрывает конкретный изъян в оценке, влияющий на то, как в целом по индустрии оцениваются computer-use агенты.

Источники