Co-RL: unsupervised reasoning возникает из разнообразной когорты в multi-agent RL

UC San Diego (Yunhao Yang, Nuno Vasconcelos, Yijiang Li et al.)

исследования официальный 2 ист. ~1 мин

Несколько декапленных моделей не делят параметры, но совместно оптимизируются через RL с наградами, полученными от соседей; разнообразие когорты по семействам моделей, размерам и перефразированным сэмплам разрывает петли обратной связи от коррелированных ошибок. Даёт +3.0–8.6% на семи LLM-бенчмарках и +2.3–7.2% на четырёх VLM-бенчмарках без каких-либо ground-truth меток.

Почему это важно

40 HF upvotes (20 августа) — рецепт без меток, который матчит или превосходит supervised reasoning-тренинг на текстовых и vision-language задачах, что снизит ценовой барьер для пост-трейнинга reasoning-моделей.

Важность: 2/5

default

Источники

официальный arXiv — Co-RL paper
официальный HuggingFace Daily Papers — Co-RL