Internal Research Debugging Evaluation
Benchmark by OpenAI
Astra card snapshot, September 2026
78.05%
GPT-6 Astra
frontier lab
Current AI self-improvement suite plus original MLE-bench and PaperBench. Graph-only scores withheld.
Benchmark by OpenAI
Astra card snapshot, September 2026
78.05%
GPT-6 Astra
Benchmark by OpenAI
Original paper v1
2.6 ± 0.2%
o3-mini-high / BasicAgent
Benchmark by OpenAI
Original paper v1
4.1 ± 0.1%
GPT-4o / BasicAgent
Benchmark by OpenAI
Original paper v1
13.2 ± 0.3%
o1-high / BasicAgent
Benchmark by OpenAI
Original paper v1
8.5 ± 0.8%
o3-mini-high / IterativeAgent
Benchmark by OpenAI
Original paper v1
24.4 ± 0.7%
o1-high / IterativeAgent
Benchmark by OpenAI
Original paper v1
26.0 ± 0.3%
o1-high / IterativeAgent, 36 h
Benchmark by OpenAI
Original paper v1 (2024)
16.9 ± 1.1%
o1-preview / AIDE
Benchmark by OpenAI
Original paper v1 (2024)
8.7 ± 0.5%
GPT-4o / AIDE
Benchmark by METR
TH1 (historical estimates)
138 minutes
GPT-5 / METR horizon evaluation
Benchmark by METR
TH1.1
214 minutes
GPT-5 / METR horizon evaluation
Benchmark by METR
TH1 (historical estimates)
94 minutes
o3 / METR horizon evaluation
Benchmark by METR
TH1.1
121 minutes
o3 / METR horizon evaluation
Benchmark by AI4AI-Bench authors
Paper v1
0.191 normalized score
GPT-5.6 Sol / Codex effort aggregate
Benchmark by AI4AI-Bench authors
Paper v1
0.135 normalized score
GPT-5.6 Terra / Codex effort aggregate
Benchmark by AI4AI-Bench authors
Paper v1
0.117 normalized score
GPT-5.6 Luna / Codex effort aggregate
Benchmark by OpenAI
Astra card snapshot, September 2026
66.72%
GPT-6 Astra
Benchmark by OpenAI
Astra card snapshot, September 2026
38.12%
GPT-6 Sol
Benchmark by OpenAI
Astra card snapshot, September 2026
61.08%
GPT-5.6 Sol
Benchmark by OpenAI
Astra card snapshot, September 2026
21.83%
GPT-6 Luna
Benchmark by OpenAI
Astra card snapshot, September 2026
22.4%
GPT-5.6 Luna
Benchmark by OpenAI
Revised, Astra card snapshot
93.80%
GPT-6 Astra
Benchmark by OpenAI
Revised, Astra card snapshot
87.18%
GPT-5.6 Sol
Benchmark by OpenAI
Astra card snapshot, September 2026
Qualitative result
GPT-6 Astra
Benchmark by OpenAI
Astra card snapshot, September 2026
Qualitative result
GPT-5.6 Sol
Benchmark by OpenAI
Astra card snapshot, September 2026
Qualitative result
GPT-6 Astra
Benchmark by OpenAI
Astra card snapshot, September 2026
Qualitative result
GPT-5.6 Sol
Benchmark by OpenAI
Astra card snapshot, September 2026
64.20%
GPT-6 Sol
Benchmark by OpenAI
Astra card snapshot, September 2026
68.32%
GPT-5.6 Sol
Benchmark by OpenAI
Astra card snapshot, September 2026
46.62%
GPT-6 Luna
Benchmark by OpenAI
Astra card snapshot, September 2026
50.8%
GPT-5.6 Luna
Benchmark by OpenAI
Original paper v1, Code-Dev variant
43.4 ± 0.8%
o1-high / IterativeAgent, PaperBench Code-Dev
Benchmark by OpenAI
Original paper v1 (2024)
0.8 ± 0.5%
GPT-4o / MLAB
Benchmark by OpenAI
Original paper v1 (2024)
4.4 ± 1.4%
GPT-4o / OpenHands
Benchmark by METR
TH1 (historical estimates)
173 minutes
GPT-5.1-codex-max / METR horizon evaluation
Benchmark by METR
TH1 (historical estimates)
8.5 minutes
GPT-4 1106 / METR horizon evaluation
Benchmark by METR
TH1 (historical estimates)
5.4 minutes
GPT-4 0314 / METR horizon evaluation
Benchmark by METR
TH1.1
3.6 minutes
GPT-4 1106 / METR horizon evaluation
Benchmark by METR
TH1.1
3.5 minutes
GPT-4 0314 / METR horizon evaluation
Benchmark by METR
TH1.1, GPT-5.6 Sol June 2026 assessment
around 11.3 hours hours
GPT-5.6 Sol / METR horizon evaluation
Benchmark by OpenAI
Original paper v1, three-paper human comparison subset
26.6%
o1-high / IterativeAgent, three-paper subset
system card · 2026-09-03 · available
original paper · 2025-04-02 · available
original paper · 2024-10-09 · available