E-13The Eval Environment
Each task instance is built fresh from pinned dependencies, seeded data, a frozen clock and recorded network — then destroyed.
Further reading
- SWE-bench: Can Language Models Resolve Real-World GitHub Issues? Jimenez et al., ICLR 2024
- SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering Yang et al., NeurIPS 2024
- OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments Xie et al., NeurIPS 2024