#agentic-rl
- Apodex 1.1: Scaling Agentic Intelligence for Complex Work Apodex research
- OPID: On-Policy Skill Distillation Improves Long-Horizon Agent RL Institute of Automation, Chinese Academy of Sciences research
- EnvHarness: Awakening Static Worlds for Agent Learning Google research
- The Verification Horizon: No Single Reward Function Works for Coding Agents at Scale Qwen (Alibaba) research
- AgentOPSD: recursive self-distillation for agentic reinforcement learning research