ClawGym II: исследование чёрно-ящичного RL на обвязке агента

Renmin University of China

исследования офиц. + СМИ 2 ист. ~1 мин

Унифицированный фреймворк чёрно-ящичного RL для обучения агентов на долгосрочных задачах, обёрнутых сложными обвязками, построенный на песочничном исполнении, обслуживающем прокси, который захватывает вызовы модели, и древовидной реконструкции траекторий, поддерживающей как PPO, так и critic-free GRPO. На Qwen3-30A3B он получает +9.98 Pass@1 на OpenClaw и +14.81 на Claude Code, стабильно на протяжении 200-400 шагов; приросты также переносятся на JobBench и OfficeQA.

Почему это важно

HF: 33 голоса. Практический рецепт для RL над сторонними обвязками агентов, где поверхность политики непрозрачна.

Важность: 3/5

HF Daily 33 upvotes, open-weights / GA marker

Источники

официальный arXiv:2608.16798