#agentic-rl
- Apodex 1.1: масштабирование агентного интеллекта для сложных задач Apodex research
- OPID: дистилляция навыков на собственной политике улучшает RL агентов с длинным горизонтом Institute of Automation, Chinese Academy of Sciences research
- EnvHarness: Awakening Static Worlds for Agent Learning Google research
- Горизонт верификации: ни одна функция вознаграждения не работает для агентов программирования при масштабировании Qwen (Alibaba) research
- AgentOPSD: рекурсивная самодистилляция для агентного обучения с подкреплением research