E-05Regression Evals
Run version A and version B over the same benchmark set; look at per-task deltas, not just the mean.
Further reading
- SWE-bench: Can Language Models Resolve Real-World GitHub Issues? Jimenez et al., ICLR 2024
- τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains Yao et al., 2024