Reddit
Открытый бенчмарк для моделей с открытым весом: от кодинга до агентов
Автор представляет публичную часть собственного бенчмарка для оценки моделей с открытым исходным кодом, включающую тесты на программирование и агентные сценарии. Оценка проводится экспертами без использования LLM-as-a-judge, а результаты фильтруются по доменам и языкам. Проект открыт для сообщества и ищет помощь в вычислительных ресурсах, разработке и проведении дополнительных тестов.
score 40r/LocalLLaMA