Evidence record

MLE-bench

Revised, Astra card snapshot · GPT-5.6 Sol · 2026-09-03

Reported result · numeric

87.18%

Mean percentile against reference solutions · percent

lab reported · extraction review: agent checked

Source and extraction

Published 2026-09-03

Evaluation setup

task count72
selection ruleUp to three leaderboard submissions
aggregate methodPercentile rank against test-time-compute reference distribution
inference budgetMax reasoning effort (Figure 56); token count not reported

Not reported: split, task snapshot, attempts per task, run count, token budget, wall clock budget, hardware, training budget, monetary cost, tool access, internet access, filtering, scaffold, evaluator version, human intervention, task exclusions, contamination concerns, comparability caveats.

Comparability

Not compared with other results.

Limitations

  • Percentile rank against a generated reference distribution, not the original MLE-bench medal rate.
  • Revised 2026 tasks and percentile scoring are incompatible with 2024 medal rates.
  • Public competition history creates contamination risk.