Назад к дайджесту
Reddit

Harness Arena — открытый бенчмарк для сравнения AI-агентов вслепую

Запущен проект Harness Arena для слепого сравнения производительности AI-агентов (Claude Code, Codex, Hermes, OpenClaw и др.) на контролируемых задачах в изолированных средах. Проект с лицензией MIT открыт для новых интеграций и обратной связи по методологии бенчмаркинга.

score 55r/AI_Agents