Назад к дайджесту
Reddit

Модель за $40 млн продаётся на калиброванной уверенности, но данные о калибровке так и не опубликованы

TypeSafe AI вышла из стелса с $40 млн, основана экс-исследователем OpenAI. Их модель Jev не генерирует текст, а возвращает типизированные ответы с вероятностями, которые, по заявлению, калиброваны. Однако нет ни одного публичного измерения калибровки — ни ECE, ни reliability diagrams, ни стандартных бенчмарков. Вместо этого компания приводит собственный eval, где правильный ответ определяется как среднее двух других моделей, что измеряет согласие, а не корректность.

score 40r/artificial