On-Policy Self-Distillation without Any Supervision

исследования официальный 2 ист. ~1 мин

U-OPSD обучает языковую модель на консенсусных псевдо-решениях, построенных на основе её собственных генераций с мажоритарным голосованием, исправляя уверенные ошибки без эталонных меток, моделей-учителей или обратной связи от среды.

Почему это важно

187 голосов на HuggingFace Daily Papers; сообщается о приросте на 8.5–10.7% относительно базовых моделей на математических бенчмарках (AIME24/25, HMMT25, MATH500, AMC23), сопоставимо с методами self-improvement с учителем.

Важность: 3/5

HuggingFace Daily Papers с 187 голосами (применён бамп-порог ≥100).

Источники