E-09Cross-Model Evals
Same tasks, same harness, models swapped — so differences are attributable.
Further reading
- SWE-bench: Can Language Models Resolve Real-World GitHub Issues? Jimenez et al., ICLR 2024
- τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains Yao et al., 2024