Agentic ESOpt: файнтюн long-horizon LLM-агентов с минимальными требованиями к GPU

National University of Singapore (Zhi Zheng, Wee Sun Lee et al.)

исследования официальный 2 ист. ~1 мин

Заменяет RL на evolution strategies для файнтюна long-horizon LLM-агентов, требуя только inference-уровневую GPU-память и поддерживая credit assignment на уровне траекторий. На WebArena-Lite улучшает агента на Qwen-3.5-27B на 6.69 пункта относительно No-Skill baseline и побеждает в 28 из 36 настроек automatic-heuristic-design на тесте.

Почему это важно

96 HF upvotes (19 августа) — предлагает жизнеспособный путь для академических лабораторий файнтюнить агентные политики frontier-масштаба на commodity GPU, обходя стоимость инфраструктуры агентного RL.

Важность: 2/5

default

Источники

официальный arXiv — Agentic ESOpt paper