preprint · 2026-08-20

AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement

Yizhe Chi, Wenyi Li, Deyao Hong, Xiaoqiu Wang, Mingju Gao, Kaisen Yang, Bingxiang He, Youjie Zheng, Calvin Xiao, Qinhuai Na

Why it matters here

Frozen repositories and hidden retraining evaluators test algorithm design. Many attempts fail to outperform the original recipe.

AI-system improvement

What to keep in mind

  • Effort aggregates differ; one-step algorithm design is not a demonstrated recursive loop.

Related evidence