Reddit
Снижение ошибки калибровки модели-судьи Jev на 68%
Автор провёл бенчмарк модели Jev на датасете TRIVIA+, показав, что обучение на размеченных примерах снизило ошибку калибровки (ECE) с 0.0982 до 0.0313. При этом способность модели обнаруживать галлюцинации практически не изменилась, что указывает на улучшение согласованности уверенности модели с реальностью, а не на рост точности классификации. Это критически важно для продакшен-систем, где пороги уверенности используются для автоматического одобрения или эскалации ответов.
score 40r/MachineLearning