Reddit
Измерена калибровка Jev: LLM победили
В бенчмарке Jev сравнили калибровку моделей с человеческими метками. Jev, обученный методом «Reinforcement Learning for Calibrated Decisions», показал больший калибровочный разрыв, чем Gemini 3.8 Flash, DeepSeek V4.1 Flash и GLM-5.3, но при этом сохранил точность 95% и самостоятельно принимает больше решений (86% в yes/no). Модель хуже откалибрована, но лучше понимает, когда она права.
score 40r/MachineLearning