On-policy само-дистилляция в диффузионных моделях
ByteDance Seed
DiffusionOPSD превращает reward-гайданс уровня изображения в явные таргеты для предсказаний чистого вывода на выбранных квери, разделяя построение таргета и его конечную реализацию. Замороженная behavior-политика генерирует траектории и поставляет квери-состояния и якоря; reward-градиенты строят ограниченные положительные и отрицательные таргеты вокруг каждого якоря; обучаемая политика фитит их как detached-супервизию через конечную подгонку перед EMA-обновлением behavior-политики. Достигает лучших финальных held-out-баллов в 19 из 20 reward-согласованных настроек на SD 3.5-M и Z-Image-Turbo и десяти оценщиках, превосходя сильнейшего конкурента до 44%, с сокращением GPU-часов тренинга на 40%/63% против DiffusionNFT.
Почему это важно
HF Daily 31 апвоут 26 августа. Даёт измеренную декомпозицию того, откуда реально приходят приросты в диффузионном пост-тренинге — контролируемые same-query эксперименты показывают, что большие приросты на построении не всегда дают большие приросты на реализации.
Важность: 3/5
HF Daily 31 апвоут