E-11Variance & Sample Size
Agents are stochastic, so a single run is one bit — and a one-task difference is usually noise.
Further reading
- SWE-bench: Can Language Models Resolve Real-World GitHub Issues? Jimenez et al., ICLR 2024
- τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains Yao et al., 2024
- Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena Zheng et al., NeurIPS 2023