Назад к дайджесту
GitHub

mupt-ai/self-bench: бенчмарк для кодовых агентов на основе репозитория

Инструмент позволяет оценивать производительность кодовых агентов и моделей ИИ, используя приватные тестовые наборы формата Harbor. Оценка строится автоматически на основе слитых пул-реквестов из указанного репозитория.

281 forksTypeScriptscore 55.2
coding-agentsswe-benchbenchmarkagent-evaluationevalsai-agentsllm-evaluationllmharbor