#harness
- StateM: harness scaling pushes GPT-5.6 Sol to 95.3% on Terminal-Bench 2.1 and the same harness adapts to DeepSeek-V4 Flash for $15 total spend research
- DarwinX: Evolving Agent Harnesses Through Natural Selection Salesforce AI Research research
- AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces Microsoft research
- DarwinX: Evolving Agent Harnesses Through Natural Selection Salesforce AI Research research
- Prime Agent: A Self-Improving RLM Harness Prime Intellect research