[{"arxiv_id":null,"authors":["Anthropic"],"categories":["ai_rd_capability"],"doi":null,"id":"opus55-card","limitations":["Environment changed between versions; scores are not comparable across versions.","Private historical infrastructure and model-graded root-cause rubrics limit external replication."],"linked_benchmark_ids":["cobench"],"linked_observation_ids":[],"linked_study_ids":[],"original_date":{"precision":"day","value":"2026-09-22"},"publication_status":"report","revised_date":null,"slug":"opus55-card","source_id":"src-opus55","summary":"CoBench 2.1 contextualizes internal R&D capability through historical issue diagnosis and explicitly warns about environment drift.","title":"Claude Opus 5.5 System Card"},{"arxiv_id":null,"authors":["OpenAI"],"categories":["ai_rd_capability","ai_system_improvement"],"doi":null,"id":"astra-card","limitations":["Internal task details and some numeric values remain unavailable in this extraction."],"linked_benchmark_ids":["openai-research-debugging","kernelgen-1p","nanogpt","posttrainbench-lite","mle-bench"],"linked_observation_ids":[],"linked_study_ids":[],"original_date":{"precision":"day","value":"2026-09-03"},"publication_status":"report","revised_date":{"precision":"day","value":"2026-09-22"},"slug":"astra-card","source_id":"src-astra","summary":"A task-specific AI self-improvement suite replaces older measures. Debugging, kernels, pretraining and post-training test different abilities.","title":"GPT-6 Astra System Card"},{"arxiv_id":null,"authors":["Google DeepMind"],"categories":["ai_rd_capability"],"doi":null,"id":"gemini37-report","limitations":["Risk-policy boundaries are not validated sufficiency thresholds for research automation."],"linked_benchmark_ids":["grb"],"linked_observation_ids":[],"linked_study_ids":[],"original_date":{"precision":"month","value":"2026-08"},"publication_status":"report","revised_date":null,"slug":"gemini37-report","source_id":"src-grb","summary":"GRB broadens disclosure of internal research engineering; known task bugs and a rough historical comparator constrain interpretation.","title":"Gemini 3.7 Flash Frontier Safety Framework Report"},{"arxiv_id":"2504.01848v1","authors":["Giulio Starace","Oliver Jaffe","Dane Sherburn","James Aung","Chan Jun Shern","Leon Maksin","Rachel Dias","Evan Mays","Benjamin Kinsella","Wyatt Thompson","Johannes Heidecke","Mia Glaese","Tejal Patwardhan"],"categories":["ai_rd_capability","research_autonomy"],"doi":null,"id":"paperbench-paper","limitations":["Historical v1 extraction; not a claim about present frontier performance."],"linked_benchmark_ids":["paperbench"],"linked_observation_ids":[],"linked_study_ids":[],"original_date":{"precision":"day","value":"2025-04-02"},"publication_status":"preprint","revised_date":null,"slug":"paperbench-paper","source_id":"src-paperbench","summary":"Paper replication receives partial rubric credit. Changing the agent scaffold helps some models while hurting another.","title":"PaperBench: Evaluating AI’s Ability to Replicate AI Research"},{"arxiv_id":"2410.07095v1","authors":["Jun Shern Chan","Neil Chowdhury","Oliver Jaffe","James Aung","Dane Sherburn","Evan Mays","Giulio Starace","Kevin Liu","Leon Maksin","Tejal Patwardhan","Lilian Weng","Aleksander Mądry"],"categories":["ai_rd_capability"],"doi":null,"id":"mle-paper","limitations":["Original v1 snapshot; later paper revisions exist and are not silently substituted."],"linked_benchmark_ids":["mle-bench"],"linked_observation_ids":[],"linked_study_ids":[],"original_date":{"precision":"day","value":"2024-10-09"},"publication_status":"preprint","revised_date":null,"slug":"mle-paper","source_id":"src-mle","summary":"Competition outcomes depend on agent scaffolds, budgets and attempts. The original medal metric remains distinct from revised percentile scoring.","title":"MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering"},{"arxiv_id":null,"authors":["METR"],"categories":["ai_rd_capability"],"doi":null,"id":"rebench-report","limitations":["Seven tasks and selected human experts limit generalization."],"linked_benchmark_ids":["re-bench"],"linked_observation_ids":[],"linked_study_ids":[],"original_date":{"precision":"day","value":"2024-11-22"},"publication_status":"report","revised_date":null,"slug":"rebench-report","source_id":"src-rebench","summary":"Agents are competitive at short resource budgets; experts gain more from longer attempts. Resource allocation matters to the comparison.","title":"Evaluating frontier AI R&D capabilities of language model agents against human experts"},{"arxiv_id":null,"authors":["METR"],"categories":["research_autonomy","evaluation_integrity"],"doi":null,"id":"time-horizon-revision","limitations":["Horizons refer to human-task duration at a success probability, not AI runtime."],"linked_benchmark_ids":["time-horizons"],"linked_observation_ids":[],"linked_study_ids":[],"original_date":{"precision":"day","value":"2026-01-29"},"publication_status":"report","revised_date":null,"slug":"time-horizon-revision","source_id":"src-th11","summary":"A revised task suite and evaluation platform change historical horizon estimates. Version identities prevent a false joined trend.","title":"Time Horizon 1.1"},{"arxiv_id":null,"authors":["Joel Becker","Nate Rush","Beth Barnes","David Rein"],"categories":["observed_rd_automation"],"doi":null,"id":"productivity-trial","limitations":["Narrow population and early-2025 tools."],"linked_benchmark_ids":["developer-productivity"],"linked_observation_ids":[],"linked_study_ids":[],"original_date":{"precision":"day","value":"2025-07-10"},"publication_status":"report","revised_date":null,"slug":"productivity-trial","source_id":"src-productivity","summary":"Randomized AI access slowed this sample of experienced developers, illustrating why benchmark gains need real-work validation.","title":"Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity"},{"arxiv_id":null,"authors":["Joel Becker","Nate Rush","Tom Cunningham","David Rein","Khalid Mahamud"],"categories":["evaluation_integrity","observed_rd_automation"],"doi":null,"id":"productivity-redesign","limitations":["Cannot infer a reliable current uplift from these selected participants."],"linked_benchmark_ids":["developer-productivity"],"linked_observation_ids":[],"linked_study_ids":[],"original_date":{"precision":"day","value":"2026-02-24"},"publication_status":"report","revised_date":null,"slug":"productivity-redesign","source_id":"src-productivity-update","summary":"Growing adoption changes who participates and which tasks are submitted. METR plans redesign because raw effects are difficult to interpret.","title":"We are Changing our Developer Productivity Experiment Design"},{"arxiv_id":null,"authors":["Sydney Von Arx","Lawrence Chan","Beth Barnes"],"categories":["evaluation_integrity"],"doi":null,"id":"reward-hacking","limitations":["Selected observed examples; not a population frequency estimate."],"linked_benchmark_ids":["re-bench"],"linked_observation_ids":[],"linked_study_ids":[],"original_date":{"precision":"day","value":"2025-06-05"},"publication_status":"report","revised_date":null,"slug":"reward-hacking","source_id":"src-hacking","summary":"Examples of agents manipulating evaluation machinery show why a higher measured reward may fail to represent a better solution.","title":"Recent Frontier Models Are Reward Hacking"},{"arxiv_id":"2608.20318v1","authors":["Yizhe Chi","Wenyi Li","Deyao Hong","Xiaoqiu Wang","Mingju Gao","Kaisen Yang","Bingxiang He","Youjie Zheng","Calvin Xiao","Qinhuai Na"],"categories":["ai_system_improvement"],"doi":null,"id":"ai4ai-paper","limitations":["Effort aggregates differ; one-step algorithm design is not a demonstrated recursive loop."],"linked_benchmark_ids":["ai4ai-bench"],"linked_observation_ids":[],"linked_study_ids":[],"original_date":{"precision":"day","value":"2026-08-20"},"publication_status":"preprint","revised_date":null,"slug":"ai4ai-paper","source_id":"src-ai4ai","summary":"Frozen repositories and hidden retraining evaluators test algorithm design. Many attempts fail to outperform the original recipe.","title":"AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement"},{"arxiv_id":null,"authors":["Anthropic"],"categories":["observed_rd_automation"],"doi":null,"id":"automation-measurements","limitations":["Model-rated self-report; extraction review is not external experimental verification."],"linked_benchmark_ids":["anthropic-rd-automation"],"linked_observation_ids":[],"linked_study_ids":[],"original_date":{"precision":"day","value":"2026-09-17"},"publication_status":"report","revised_date":null,"slug":"automation-measurements","source_id":"src-automation","summary":"An operational work basket distinguishes assistance, collaboration, leadership and autonomy, with approximate labor weights.","title":"Measurements for understanding the pace of AI development inside frontier labs"},{"arxiv_id":"2505.22954v1","authors":["Jenny Zhang","Shengran Hu","Cong Lu","Robert Lange","Jeff Clune"],"categories":["recursive_improvement_evidence"],"doi":null,"id":"dgm-paper","limitations":["Historical v1; subsequent revisions exist. Coding-task improvement does not prove open-ended accelerating AI R&D."],"linked_benchmark_ids":[],"linked_observation_ids":[],"linked_study_ids":["dgm-study"],"original_date":{"precision":"day","value":"2025-05-29"},"publication_status":"preprint","revised_date":null,"slug":"dgm-paper","source_id":"src-dgm","summary":"Agents modify their own scaffolds and reuse descendants in further search while foundation-model weights stay fixed.","title":"Darwin Gödel Machine: Open-Ended Evolution of Self-Improving Agents"},{"arxiv_id":null,"authors":["Google DeepMind"],"categories":["ai_system_improvement","recursive_improvement_evidence"],"doi":null,"id":"alphaevolve-report","limitations":["No controlled multi-generation optimizer-speedup result in this report."],"linked_benchmark_ids":["alphaevolve-training"],"linked_observation_ids":[],"linked_study_ids":["alphaevolve-study"],"original_date":{"precision":"day","value":"2025-05-14"},"publication_status":"report","revised_date":null,"slug":"alphaevolve-report","source_id":"src-alphaevolve","summary":"Evolutionary program search yields reported production improvements, including training kernels. A better target artifact is distinct from a better optimizer.","title":"AlphaEvolve: A Gemini-powered coding agent for designing advanced algorithms"},{"arxiv_id":"2609.11873v1","authors":["Yi Duan","Ying Liu","Zirui Tang","Haodong Chen","Jun Zhou","Yumou Liu","Bangrui Xu","Yukai Wu","Sidi Chen","Yuhan Zhou","Haoyu Wang","Xiaoyou Yu","Shaokun Han","Xuzhou Zhu","Le Zhou","Bolin Lu","Wei Zhou","Jiachen Liu","Nuozhou Fang","Jiaxin Tian","Ruoyu Chen","Yuxuan Li","Kai Zuo","Kaiyan Zhang","Jiantao Qiu","Conghui He","Guoliang Li","Bowen Zhou","Zhiyuan Liu","Zhoufutu Wen","Jihua Kang","Xuanhe Zhou","Fan Wu"],"categories":["research_autonomy","recursive_improvement_evidence"],"doi":"10.48550/arXiv.2609.11873","id":"duan-paper","limitations":["Historical supplied v1 snapshot. The public index lists v3 on September 22; this record preserves the supplied version rather than silently applying later revisions.","A survey classification is not independent replication of its cited systems."],"linked_benchmark_ids":[],"linked_observation_ids":[],"linked_study_ids":[],"original_date":{"precision":"day","value":"2026-09-10"},"publication_status":"preprint","revised_date":null,"slug":"last-ai-built-by-humans","source_id":"src-duan-v1","summary":"An autonomy-centered taxonomy of which improvement decisions an AI controls, what persists, and what remains externally governed.","title":"The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement"},{"arxiv_id":"2609.26457v1","authors":["Dhruv Srikanth","Bingchen Zhao","Dixing Xu","Yuxiang Wu","Zhengyao Jiang"],"categories":["ai_system_improvement","recursive_improvement_evidence"],"doi":"10.48550/arXiv.2609.26457","id":"aide2-paper","limitations":["Company-authored evaluation; no independent replication recorded.","September technical report differs from July blog; no numeric results merged across them."],"linked_benchmark_ids":[],"linked_observation_ids":[],"linked_study_ids":["aide2-study"],"original_date":{"precision":"day","value":"2026-09-22"},"publication_status":"preprint","revised_date":null,"slug":"aide2","source_id":"src-aide2","summary":"Research-agent harness evolution with held-out evaluation and a separate outer-improver comparison.","title":"Recursive self-improvement of AI research agents"}]
