[{"author_claims":"Authors describe a self-improving agent with reusable descendants.","base_model_ids":["Claude 3.5 Sonnet (New)","o3-mini"],"baseline_comparisons":"Ablations remove self-improvement or open-ended exploration.","budget_matching":"Search incurs more compute than initial-agent evaluation; not a constant-cost comparison.","changes":["scaffold","tools"],"efficiency_evidence":"No general accelerating gain-per-compute conclusion established.","evaluation_tasks":"SWE-bench coding tasks with Claude 3.5 Sonnet (New), and Polyglot with o3-mini; Claude powers self-modification in both experiments. The 50-task Polyglot search subset differs from full evaluation.","fixed_components":["Foundation model weights","Outer archive-selection experiment"],"generation_outcomes":[{"generation":0,"result":"SWE-bench 20.0%; full Polyglot 14.2%."},{"generation":80,"result":"Best discovered agent: SWE-bench 50.0%; full Polyglot 30.7%. Endpoints are best-of-search, not one 80-generation lineage."}],"generations_accepted":null,"generations_attempted":80,"held_out_transfer":"Full Polyglot and cross-model/language transfer assessed by authors.","human_contributions":"Human-designed evaluation, initial agent, safety boundaries and experiment setup.","id":"dgm-study","improved_optimizer_used_later":"yes","improvement_evidence":"Coding performance improves over the initial agent in the reported experiment.","limitations":["Best-of-search endpoints are not a continuous generational series.","Later v2/v3 results not reconciled in this historical record."],"paper_id":"dgm-paper","publication_status":"preprint","resource_accounting":"80 generated-agent iterations; 2 parallel SWE-bench and 4 parallel Polyglot iterations. No new experiments run by this tracker.","source_refs":[{"locator":"v1 §§4.1–4.4; Figure 2; §4.1 specifies model roles","source_id":"src-dgm"}],"system_ids":["dgm"],"title":"Darwin Gödel Machine: scaffold-level recursive improvement","tracker_interpretation":"Evidence for scaffold-level recursion with fixed underlying model weights; bounded coding evaluations."},{"author_claims":"Algorithms contribute to training the model family underlying the agent.","base_model_ids":["Gemini Flash","Gemini Pro"],"baseline_comparisons":"Existing production kernels and algorithms.","budget_matching":"No resource-matched recursive optimizer comparison reported.","changes":["other"],"efficiency_evidence":"Target-code efficiency improves; optimizer efficiency across generations unestablished.","evaluation_tasks":"Algorithm discovery and production training kernels.","fixed_components":["Model ensemble used to propose code; no optimizer succession experiment reported"],"generation_outcomes":[],"generations_accepted":null,"generations_attempted":null,"held_out_transfer":"Multiple reported application areas, not a held-out recursive-agent test.","human_contributions":"Experts define evaluators and integrate validated changes.","id":"alphaevolve-study","improved_optimizer_used_later":"unknown","improvement_evidence":"Reported training and kernel improvements.","limitations":["No evidence here of accelerating returns per unit of search compute."],"paper_id":"alphaevolve-report","publication_status":"report","resource_accounting":"Search compute not fully disclosed in the article.","source_refs":[{"locator":"Designing better algorithms; Enhancing AI training and inference","source_id":"src-alphaevolve"}],"system_ids":["alphaevolve"],"title":"AlphaEvolve: iterative artifact optimization","tracker_interpretation":"Feedback into training infrastructure is relevant, but the report does not isolate a successor becoming a better optimizer."},{"author_claims":"Harness research-efficiency gains and transfer.","base_model_ids":["Claude Opus 4.7","Gemini 3 Flash"],"baseline_comparisons":"Initial and human-engineered agents; outer-loop comparison.","budget_matching":"Per-benchmark constraints; three seeds per outer-improver arm.","changes":["scaffold","prompt"],"efficiency_evidence":"Outer-improver advantage inconclusive.","evaluation_tasks":"AI R&D task families; four external benchmarks.","fixed_components":["Model weights","Outer selection rule","Task families and private scoring"],"generation_outcomes":[],"generations_accepted":7,"generations_attempted":99,"held_out_transfer":"External-task gains reported.","human_contributions":"Evaluator design, seed agents and resource limits.","id":"aide2-study","improved_optimizer_used_later":"yes","improvement_evidence":"Seven accepted rewrites among 99 proposals (100 nodes including seed).","limitations":["No independent evaluation.","Main-run selection gains do not establish acceleration."],"paper_id":"aide2-paper","publication_status":"preprint","resource_accounting":"Fixed per-evaluation constraints; eight-day main run.","source_refs":[{"locator":"v1 §§2–3.6, especially ignition test §3.6","source_id":"src-aide2"}],"system_ids":["aide2"],"title":"AIDE²: inherited harness and outer-improver test","tracker_interpretation":"Bounded structural L5; effective outer recursion unestablished."}]
