GitHub
mupt-ai/self-bench: бенчмарк для кодовых агентов на основе репозитория
Инструмент позволяет оценивать производительность кодовых агентов и моделей ИИ, используя приватные тестовые наборы формата Harbor. Оценка строится автоматически на основе слитых пул-реквестов из указанного репозитория.
281 forksTypeScriptscore 55.2
coding-agentsswe-benchbenchmarkagent-evaluationevalsai-agentsllm-evaluationllmharbor