Назад к дайджесту
GitHub

Benchmark для оценки агентов ИИ на задачах редактирования кода

Платформа для тестирования кодовых агентов и систем на 226 детерминированных задачах редактирования файлов с побайтовой верификацией результатов. Проект включает публичный лидерборд для сравнения эффективности различных AI-инструментов.

295 forksJavaScriptscore 73
coding-agentsbenchmarkevaluationai-agentscode-editingdeveloper-toolsllm-benchmarkagent-harnessllmcoding-agent-benchmark