Benchmark
AI4AI-Bench
Benchmark by AI4AI-Bench authors
Paper v1
0.174 normalized score
Kimi K3 / Claude Code effort aggregate
frontier lab
Only Kimi K3 in the original AI4AI-Bench study is included.
Benchmark by AI4AI-Bench authors
Paper v1
0.174 normalized score
Kimi K3 / Claude Code effort aggregate