ClawGym II: исследование чёрно-ящичного RL на обвязке агента
Renmin University of China
Унифицированный фреймворк чёрно-ящичного RL для обучения агентов на долгосрочных задачах, обёрнутых сложными обвязками, построенный на песочничном исполнении, обслуживающем прокси, который захватывает вызовы модели, и древовидной реконструкции траекторий, поддерживающей как PPO, так и critic-free GRPO. На Qwen3-30A3B он получает +9.98 Pass@1 на OpenClaw и +14.81 на Claude Code, стабильно на протяжении 200-400 шагов; приросты также переносятся на JobBench и OfficeQA.
Почему это важно
HF: 33 голоса. Практический рецепт для RL над сторонними обвязками агентов, где поверхность политики непрозрачна.
Важность: 3/5
HF Daily 33 upvotes, open-weights / GA marker
Источники
официальный
arXiv:2608.16798