Robuta

https://arxiv.org/abs/2508.09101 [2508.09101] AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators Abstract page for arXiv paper 2508.09101: AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators large language models