StateM: масштабирование harness поднимает GPT-5.6 Sol до 95,3% на Terminal-Bench 2.1, и тот же harness адаптируется к DeepSeek-V4 Flash при общих затратах $15
Agent-native среда выполнения, организующая исполнение вокруг устойчивых состояний, локального контекста фаз, проверяемых переходов, восстанавливаемых runbook'ов и версионированных практик. На Terminal-Bench 2.1 поднимает GPT-5.5 xhigh с 83,1% до 92,1%, выводит GPT-5.6 Sol xhigh на 95,3% сырой точности и адаптирует тот же harness к DeepSeek-V4 Flash менее чем за $38 с общими затратами на API $15 против $574,68 у GPT-референса.
Почему это важно
212 upvotes на HuggingFace Daily Papers (топ 18 августа). Утверждает, что долгосрочные сбои агентов — это проблемы harness'а, а не пределы модели, и показывает, что один и тот же harness переносится между GPT-5.6 и DeepSeek-V4 со снижением стоимости ~38x — практичный вывод для всех, кто запускает кодинг-агентов.
Важность: 4/5
HF Daily 212 upvotes