On-Policy Self-Distillation without Any Supervision
U-OPSD обучает языковую модель на консенсусных псевдо-решениях, построенных на основе её собственных генераций с мажоритарным голосованием, исправляя уверенные ошибки без эталонных меток, моделей-учителей или обратной связи от среды.
Почему это важно
187 голосов на HuggingFace Daily Papers; сообщается о приросте на 8.5–10.7% относительно базовых моделей на математических бенчмарках (AIME24/25, HMMT25, MATH500, AMC23), сопоставимо с методами self-improvement с учителем.
Важность: 3/5
HuggingFace Daily Papers с 187 голосами (применён бамп-порог ≥100).