Назад к дайджесту
Reddit

Измерена калибровка Jev: LLM победили

В бенчмарке Jev сравнили калибровку моделей с человеческими метками. Jev, обученный методом «Reinforcement Learning for Calibrated Decisions», показал больший калибровочный разрыв, чем Gemini 3.8 Flash, DeepSeek V4.1 Flash и GLM-5.3, но при этом сохранил точность 95% и самостоятельно принимает больше решений (86% в yes/no). Модель хуже откалибрована, но лучше понимает, когда она права.

score 40r/MachineLearning