[{"access_status":"available","hash":"7311c9c6bbb16d012f1c12c7418b05949fcf7ae3e30d2c40f22050074b2a7378","hash_kind":"original_bytes","id":"src-opus55","primary":true,"publication_date":{"precision":"day","value":"2026-09-22"},"publisher_id":"anthropic","repository_commit":null,"resolved_url":null,"retrieved_at":"2026-09-26T04:47:27Z","source_check_attempts":[{"checked_at":"2026-09-26T04:47:27Z","notes":"Original source inspected by Codex; extraction check, not experimental replication.","result":"success"}],"source_type":"system_card","title":"Claude Opus 5.5 System Card","updated_date":null,"url":"https://www.anthropic.com/claude-opus-5-5-system-card"},{"access_status":"available","hash":"bb824295442992a152dd4596b5f615697b194e79c794a9a4c1dd6170279ee20f","hash_kind":"original_bytes","id":"src-astra","primary":true,"publication_date":{"precision":"day","value":"2026-09-03"},"publisher_id":"openai","repository_commit":null,"resolved_url":null,"retrieved_at":"2026-09-26T04:47:27Z","source_check_attempts":[{"checked_at":"2026-09-26T04:47:27Z","notes":"Original source inspected by Codex; extraction check, not experimental replication.","result":"success"}],"source_type":"system_card","title":"GPT-6 Astra System Card","updated_date":{"precision":"day","value":"2026-09-22"},"url":"https://deploymentsafety.openai.com/gpt-6-astra"},{"access_status":"available","hash":"f0eec853b7371aac56d3ef3e21f2e0f52e3ca7eb60db5119ee5b4234f66d522c","hash_kind":"original_bytes","id":"src-grb","primary":true,"publication_date":{"precision":"month","value":"2026-08"},"publisher_id":"deepmind","repository_commit":null,"resolved_url":null,"retrieved_at":"2026-09-26T04:47:27Z","source_check_attempts":[{"checked_at":"2026-09-26T04:47:27Z","notes":"Original source inspected by Codex; extraction check, not experimental replication.","result":"success"}],"source_type":"risk_report","title":"Gemini 3.7 Flash Frontier Safety Framework Report","updated_date":null,"url":"https://storage.googleapis.com/deepmind-media/gemini/gemini_3-7_flash_fsf_report.pdf"},{"access_status":"available","hash":null,"hash_kind":null,"id":"src-gemini3","primary":true,"publication_date":{"precision":"month","value":"2025-11"},"publisher_id":"deepmind","repository_commit":null,"resolved_url":null,"retrieved_at":"2026-09-26T04:47:27Z","source_check_attempts":[{"checked_at":"2026-09-26T04:47:27Z","notes":"Original source inspected by Codex; extraction check, not experimental replication.","result":"success"}],"source_type":"risk_report","title":"Gemini 3 Pro Frontier Safety Framework Report, v2","updated_date":null,"url":"https://storage.googleapis.com/deepmind-media/gemini/gemini_3_pro_fsf_report.pdf"},{"access_status":"available","hash":"60938176890f24ede8eb7040c02b4e8f8b3666c38977af3d5c863123f5a2024c","hash_kind":"original_bytes","id":"src-ai4ai","primary":true,"publication_date":{"precision":"day","value":"2026-08-20"},"publisher_id":"einsia","repository_commit":null,"resolved_url":null,"retrieved_at":"2026-09-26T04:47:27Z","source_check_attempts":[{"checked_at":"2026-09-26T04:47:27Z","notes":"Original source inspected by Codex; extraction check, not experimental replication.","result":"success"}],"source_type":"original_paper","title":"AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement","updated_date":null,"url":"https://arxiv.org/html/2608.20318v1"},{"access_status":"available","hash":"1704aec76a9740f8f4af9e47a9008d79aaddc17a0e16f72d3eccc39db568d27d","hash_kind":"original_bytes","id":"src-paperbench","primary":true,"publication_date":{"precision":"day","value":"2025-04-02"},"publisher_id":"openai","repository_commit":null,"resolved_url":null,"retrieved_at":"2026-09-26T04:47:27Z","source_check_attempts":[{"checked_at":"2026-09-26T04:47:27Z","notes":"Original source inspected by Codex; extraction check, not experimental replication.","result":"success"}],"source_type":"original_paper","title":"PaperBench: Evaluating AI’s Ability to Replicate AI Research (v1)","updated_date":null,"url":"https://arxiv.org/html/2504.01848v1"},{"access_status":"available","hash":"ecfe27c79181a88c1358822316198b4e085441c2e26379b3c6ef49312918bf7d","hash_kind":"original_bytes","id":"src-mle","primary":true,"publication_date":{"precision":"day","value":"2024-10-09"},"publisher_id":"openai","repository_commit":null,"resolved_url":null,"retrieved_at":"2026-09-26T04:47:27Z","source_check_attempts":[{"checked_at":"2026-09-26T04:47:27Z","notes":"Original source inspected by Codex; extraction check, not experimental replication.","result":"success"}],"source_type":"original_paper","title":"MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering (v1)","updated_date":null,"url":"https://arxiv.org/html/2410.07095v1"},{"access_status":"available","hash":"4c76602bcdc168fa395218ec0bd0e893796852092e47e84503107e0df86d3b9d","hash_kind":"original_bytes","id":"src-th11","primary":true,"publication_date":{"precision":"day","value":"2026-01-29"},"publisher_id":"metr","repository_commit":null,"resolved_url":null,"retrieved_at":"2026-09-26T04:47:27Z","source_check_attempts":[{"checked_at":"2026-09-26T04:47:27Z","notes":"Original source inspected by Codex; extraction check, not experimental replication.","result":"success"}],"source_type":"organizational_research_article","title":"Time Horizon 1.1","updated_date":null,"url":"https://metr.org/blog/2026-1-29-time-horizon-1-1/"},{"access_status":"available","hash":null,"hash_kind":null,"id":"src-rebench","primary":true,"publication_date":{"precision":"day","value":"2024-11-22"},"publisher_id":"metr","repository_commit":null,"resolved_url":null,"retrieved_at":"2026-09-26T04:47:27Z","source_check_attempts":[{"checked_at":"2026-09-26T04:47:27Z","notes":"Original source inspected by Codex; extraction check, not experimental replication.","result":"success"}],"source_type":"organizational_research_article","title":"Evaluating frontier AI R&D capabilities of language model agents against human experts","updated_date":null,"url":"https://metr.org/blog/2024-11-22-evaluating-r-d-capabilities-of-llms/"},{"access_status":"available","hash":null,"hash_kind":null,"id":"src-productivity","primary":true,"publication_date":{"precision":"day","value":"2025-07-10"},"publisher_id":"metr","repository_commit":null,"resolved_url":null,"retrieved_at":"2026-09-26T04:47:27Z","source_check_attempts":[{"checked_at":"2026-09-26T04:47:27Z","notes":"Original source inspected by Codex; extraction check, not experimental replication.","result":"success"}],"source_type":"organizational_research_article","title":"Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity","updated_date":null,"url":"https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/"},{"access_status":"available","hash":null,"hash_kind":null,"id":"src-productivity-update","primary":true,"publication_date":{"precision":"day","value":"2026-02-24"},"publisher_id":"metr","repository_commit":null,"resolved_url":null,"retrieved_at":"2026-09-26T04:47:27Z","source_check_attempts":[{"checked_at":"2026-09-26T04:47:27Z","notes":"Original source inspected by Codex; extraction check, not experimental replication.","result":"success"}],"source_type":"organizational_research_article","title":"We are Changing our Developer Productivity Experiment Design","updated_date":null,"url":"https://metr.org/blog/2026-02-24-uplift-update/"},{"access_status":"available","hash":null,"hash_kind":null,"id":"src-hacking","primary":true,"publication_date":{"precision":"day","value":"2025-06-05"},"publisher_id":"metr","repository_commit":null,"resolved_url":null,"retrieved_at":"2026-09-26T04:47:27Z","source_check_attempts":[{"checked_at":"2026-09-26T04:47:27Z","notes":"Original source inspected by Codex; extraction check, not experimental replication.","result":"success"}],"source_type":"organizational_research_article","title":"Recent Frontier Models Are Reward Hacking","updated_date":null,"url":"https://metr.org/blog/2025-06-05-recent-reward-hacking/"},{"access_status":"available","hash":null,"hash_kind":null,"id":"src-automation","primary":true,"publication_date":{"precision":"day","value":"2026-09-17"},"publisher_id":"anthropic","repository_commit":null,"resolved_url":null,"retrieved_at":"2026-09-26T04:47:27Z","source_check_attempts":[{"checked_at":"2026-09-26T04:47:27Z","notes":"Original source inspected by Codex; extraction check, not experimental replication.","result":"success"}],"source_type":"organizational_research_article","title":"Measurements for understanding the pace of AI development inside frontier labs","updated_date":null,"url":"https://www.anthropic.com/institute/measuring-pace-of-ai-development"},{"access_status":"available","hash":"effea2116602683c69b5807823778af3814987cb187ae93bc6ea31f2ccc7d07b","hash_kind":"original_bytes","id":"src-dgm","primary":true,"publication_date":{"precision":"day","value":"2025-05-29"},"publisher_id":"dgm-authors","repository_commit":null,"resolved_url":null,"retrieved_at":"2026-09-26T04:47:27Z","source_check_attempts":[{"checked_at":"2026-09-26T04:47:27Z","notes":"Original source inspected by Codex; extraction check, not experimental replication.","result":"success"}],"source_type":"original_paper","title":"Darwin Gödel Machine: Open-Ended Evolution of Self-Improving Agents (v1)","updated_date":null,"url":"https://arxiv.org/html/2505.22954v1"},{"access_status":"available","hash":null,"hash_kind":null,"id":"src-alphaevolve","primary":true,"publication_date":{"precision":"day","value":"2025-05-14"},"publisher_id":"deepmind","repository_commit":null,"resolved_url":null,"retrieved_at":"2026-09-26T04:47:27Z","source_check_attempts":[{"checked_at":"2026-09-26T04:47:27Z","notes":"Original source inspected by Codex; extraction check, not experimental replication.","result":"success"}],"source_type":"organizational_research_article","title":"AlphaEvolve: A Gemini-powered coding agent for designing advanced algorithms","updated_date":null,"url":"https://deepmind.google/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/"},{"access_status":"available","hash":"9fde92cba4d50a38a42570c25b89fe116312f746659e560290d344ead91f7a9b","hash_kind":"original_bytes","id":"src-duan-v1","primary":true,"publication_date":{"precision":"day","value":"2026-09-10"},"publisher_id":"duan-authors","repository_commit":null,"resolved_url":null,"retrieved_at":"2026-09-26T05:09:03Z","source_check_attempts":[{"checked_at":"2026-09-26T05:09:03Z","notes":"Original supplied PDF read locally; v1 printed in document. Public index has later revisions, not silently substituted.","result":"success"}],"source_type":"original_paper","title":"The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement — supplied v1","updated_date":null,"url":"https://arxiv.org/abs/2609.11873v1"},{"access_status":"available","hash":"823660bd50c747408b7c3249497efee2f5faccc558d16b31ee2c61baf5b5e400","hash_kind":"original_bytes","id":"src-aide2","primary":true,"publication_date":{"precision":"day","value":"2026-09-22"},"publisher_id":"weco","repository_commit":null,"resolved_url":null,"retrieved_at":"2026-09-26T05:09:03Z","source_check_attempts":[{"checked_at":"2026-09-26T05:09:03Z","notes":"Original v1 HTML retrieved and checked.","result":"success"}],"source_type":"original_paper","title":"Recursive self-improvement of AI research agents — AIDE² v1","updated_date":null,"url":"https://arxiv.org/html/2609.26457v1"},{"access_status":"available","hash":null,"hash_kind":null,"id":"src-weco-taxonomy","primary":true,"publication_date":{"precision":"day","value":"2026-07-10"},"publisher_id":"weco","repository_commit":null,"resolved_url":null,"retrieved_at":"2026-09-26T05:09:03Z","source_check_attempts":[{"checked_at":"2026-09-26T05:09:03Z","notes":"Original author page viewed; linked only as an alternative taxonomy, not merged with B0–L5.","result":"success"}],"source_type":"organizational_research_article","title":"Weco: 4 Levels of Recursive Self-Improvement (alternative taxonomy)","updated_date":null,"url":"https://www.weco.ai/blog/4-levels-of-recursive-self-improvement"},{"access_status":"available","hash":"70bcda79a248255d2c858600cb1fecae9ea30278c942684754df0bca71ca8315","hash_kind":"original_bytes","id":"src-gemini31-card","primary":true,"publication_date":{"precision":"day","value":"2026-02-19"},"publisher_id":"deepmind","repository_commit":null,"resolved_url":null,"retrieved_at":"2026-09-27T04:15:49.829513Z","source_check_attempts":[{"checked_at":"2026-09-27T04:15:49.829513Z","notes":"PDF printed page 9 and official HTML model card checked.","result":"success"}],"source_type":"system_card","title":"Gemini 3.1 Pro Model Card","updated_date":null,"url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-1-Pro-Model-Card.pdf"},{"access_status":"available","hash":"232140ff97a4f324e2b1bdd918d243be6f0a16ddc999ca0e3d90d7b6ece002bf","hash_kind":"original_bytes","id":"src-metr-gpt56-sol","primary":true,"publication_date":{"precision":"day","value":"2026-06-26"},"publisher_id":"metr","repository_commit":null,"resolved_url":null,"retrieved_at":"2026-09-27T04:17:28Z","source_check_attempts":[{"checked_at":"2026-09-27T04:17:28Z","notes":"Original public METR assessment inspected for 50%-horizon point and interval.","result":"success"},{"checked_at":"2026-09-27T05:02:16Z","notes":"Original METR HTML saved to .cache/sources/completeness/metr-gpt56-sol.html; SHA-256 recorded; source lines 41–45 checked.","result":"success"}],"source_type":"organizational_research_article","title":"Summary of METR's predeployment evaluation of GPT-5.6 Sol","updated_date":null,"url":"https://metr.org/blog/2026-06-26-gpt-5-6-sol/"}]
