Predictability on τ-bench (airline, clean)
How well does the agent's expressed confidence predict whether it will answer correctly? See full definition →
Sub-metric Comparison
Calibration Curves
Claude 3 Haiku
Claude 3.5 Haiku
Claude 4 Sonnet
Claude 4.5 Opus
Claude 4.7 Opus
GPT 5.2
GPT 5.2 (medium)
GPT 5.5
GPT-4 Turbo
GPT-4o mini
Gemini 2.5 Flash
Gemini 2.5 Pro
Gemini 3.1 Pro
Gemini 3.5 Flash
o1
Accuracy-Coverage Curves
Claude 3 Haiku
Claude 3.5 Haiku
Claude 4 Sonnet
Claude 4.5 Opus
Claude 4.7 Opus
GPT 5.2
GPT 5.2 (medium)
GPT 5.5
GPT-4 Turbo
GPT-4o mini
Gemini 2.5 Flash
Gemini 2.5 Pro
Gemini 3.1 Pro
Gemini 3.5 Flash
o1
Agent Leaderboard — Predictability
| # | Agent | Acc | Reliability | Predictability Agg | Cal | AUROC | Brier |
|---|---|---|---|---|---|---|---|
| 1 | 84.6% | 0.89 | 0.87 | 0.93 | 0.70 | 0.87 | |
| 2 | 78.2% | 0.86 | 0.85 | 0.90 | 0.67 | 0.85 | |
| 3 | 80.8% | 0.88 | 0.85 | 0.90 | 0.70 | 0.85 | |
| 4 | 79.5% | 0.89 | 0.84 | 0.89 | 0.72 | 0.84 | |
| 5 | 82.1% | 0.86 | 0.83 | 0.83 | 0.57 | 0.83 | |
| 6 | 80.8% | 0.86 | 0.82 | 0.81 | 0.52 | 0.82 | |
| 7 | 71.8% | 0.81 | 0.78 | 0.77 | 0.67 | 0.78 | |
| 8 | 66.2% | 0.81 | 0.74 | 0.83 | 0.52 | 0.74 | |
| 9 | 67.9% | 0.82 | 0.74 | 0.77 | 0.54 | 0.74 | |
| 10 | 60.3% | 0.81 | 0.69 | 0.73 | 0.57 | 0.69 | |
| 11 | 59.0% | 0.72 | 0.60 | 0.60 | 0.53 | 0.60 | |
| 12 | 57.7% | 0.72 | 0.58 | 0.59 | 0.46 | 0.58 | |
| 13 | 29.5% | 0.71 | 0.47 | 0.46 | 0.42 | 0.47 | |
| 14 | 20.5% | 0.70 | 0.38 | 0.33 | 0.41 | 0.38 | |
| 15 | 29.5% | 0.67 | 0.35 | 0.34 | 0.36 | 0.35 |