#credit-assignment
- AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning Tsinghua University research
- ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment Shanghai Jiao Tong University research
- AgentOPSD: recursive self-distillation for agentic reinforcement learning research
- Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements National University of Singapore (Zhi Zheng, Wee Sun Lee et al.) research