Назад к дайджесту
Reddit

Только ли мне кажется, что текущие бенчмарки LLM не отражают реальную полезность? (Gemma 4 против Gemini/Claude Opus)

Автор утверждает, что текущие бенчмарки LLM не отражают реальную полезность моделей в практических задачах. В сравнительном тесте Gemma 4 (26B) показала лучшее понимание нюансов и следование инструкциям по сравнению с Gemini 3.5 Flash и Claude Opus 5. Вывод: существующие метрики не учитывают потребность в точном следовании замыслу и отсутствии «AI-стиля».

score 55r/LocalLLaMA