#reward-modeling
- Z-Reward: Score Distributions Instead of Scalar Rewards for Image Generation RLHF Alibaba research
- OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models NLP Group of The University of Hong Kong research
- QUBRIC: Co-Designing Queries and Rubrics Extends RLVR to Open-Ended Reasoning Domains research
- OSReward benchmarks cross-platform computer-use reward models University of Hong Kong research