Co-RL: unsupervised reasoning возникает из разнообразной когорты в multi-agent RL
UC San Diego (Yunhao Yang, Nuno Vasconcelos, Yijiang Li et al.)
Несколько декапленных моделей не делят параметры, но совместно оптимизируются через RL с наградами, полученными от соседей; разнообразие когорты по семействам моделей, размерам и перефразированным сэмплам разрывает петли обратной связи от коррелированных ошибок. Даёт +3.0–8.6% на семи LLM-бенчмарках и +2.3–7.2% на четырёх VLM-бенчмарках без каких-либо ground-truth меток.
Почему это важно
40 HF upvotes (20 августа) — рецепт без меток, который матчит или превосходит supervised reasoning-тренинг на текстовых и vision-language задачах, что снизит ценовой барьер для пост-трейнинга reasoning-моделей.
Важность: 2/5
default
Источники
официальный
arXiv — Co-RL paper
официальный
HuggingFace Daily Papers — Co-RL