Benchmark2025-04-02PaperBenchBenchmark by OpenAIOriginal paper v16.0 ± 0.3%DeepSeek-R1 / BasicAgentPaperBench: Evaluating AI’s Ability to Replicate AI Research (v1)↗