Reddit
Почему artificialanalysis.ai ставит Gemma 4 выше Qwen3.6 27b в бенчмарке SciCode
Обсуждение рейтинга языковых моделей в бенчмарке SciCode: Gemma 4 опережает Qwen3.6 27b, что противоречит опыту разработчиков в реальных задачах. Автор задаётся вопросом, отражает ли это реальное качество моделей или проблемы методологии бенчмаркинга.
score 40r/LocalLLaMA