Назад к дайджесту
Reddit

Почему artificialanalysis.ai ставит Gemma 4 выше Qwen3.6 27b в бенчмарке SciCode

Обсуждение рейтинга языковых моделей в бенчмарке SciCode: Gemma 4 опережает Qwen3.6 27b, что противоречит опыту разработчиков в реальных задачах. Автор задаётся вопросом, отражает ли это реальное качество моделей или проблемы методологии бенчмаркинга.

score 40r/LocalLLaMA