Annotations as Rollouts: эффективный и масштабируемый reinforcement learning для видео-MLLM
OraRL вводит декоррелированный advantage-оценщик для RL-пост-тренинга видео-MLLM. Policy rollouts устанавливают oracle-free baseline; разрыв oracle-policy модулирует направленное усиление и отдельное detached oracle advantage. Sign-balanced pruning сохраняет только oracle и самые сильные rollouts по знаку, поэтому методу нужно лишь 2,2x от шагового времени SFT против 4,9x у GRPO+CoT. Масштабируется от 0,8B до 9B и до 100k промптов. Полученная Video-ORA-9B декодирует за 130 мс без CoT (против 4 780 мс), поднимает temporal mIoU с 62,5 до 66,0, tracking AO с 73,0 до 78,2, сегментацию с 64,3 до 70,4 и набирает 73,1 на VSI-Bench против 55,0 у GPT-5 и 55,1 у Gemini-3-Pro.
Почему это важно
HF Daily 61 апвоут 26 августа. Переосмысляет роль человеческих аннотаций как oracle-rollouts в on-policy группах, обходя режим отказа «advantage inversion». Демонстрирует практический путь к RL-пост-тренингу видео-MLLM без chain-of-thought, с результатами на уровне frontier на VSI-Bench.
Важность: 3/5
HF Daily 61 апвоут