Benchmark
Research outcome prediction
Benchmark by Research outcome prediction authors
1,585 later-paper idea pairs
77.0%
Fine-tuned GPT-4.1 plus paper retrieval
academic group
Original academic preprint authors; no institutional endorsement inferred.
Benchmark by Research outcome prediction authors
1,585 later-paper idea pairs
77.0%
Fine-tuned GPT-4.1 plus paper retrieval
Benchmark by Research outcome prediction authors
45-pair NLP expert-comparison subset
64.4%
Fine-tuned GPT-4.1 plus paper retrieval
Benchmark by Research outcome prediction authors
33 scored unpublished prompting ideas
63.6%
Fine-tuned GPT-4.1 plus paper retrieval
original paper · 2025-06-01 · available