#reward-modeling
- Z-Reward: распределения оценок вместо скалярных наград для RLHF в генерации изображений Alibaba research
- OSReward: стандартизированная оценка кросс-платформенных reward-моделей для computer-use NLP Group of The University of Hong Kong research
- QUBRIC: Co-Designing Queries and Rubrics Extends RLVR to Open-Ended Reasoning Domains research
- OSReward тестирует кросс-платформенные модели вознаграждения для computer-use University of Hong Kong research