Назад к дайджесту
Reddit

Я сравнил Jev с gpt-5.6-luna в бенчмарках

Пользователь прогнал модель Jev от TypeSafe против gpt-5.6-luna на 49 задачах (около 8 200 примеров). Jev не генерирует текст, а выдаёт вероятности ответов, и обошёл базовую модель в 42 из 49 задач, показав меньшую задержку (~105 мс против 700–800 мс), меньшую стоимость и вдвое меньшую ошибку калибровки. На рассуждающих бенчмарках (LogiQA, WinoGrande, ARC-Challenge, MMLU) и на сгенерированных математических задачах Jev заметно превзошёл gpt-5.6-luna, но проиграл в подсчёте объектов, выборе интентов и корректности сумм вероятностей.

score 40r/OpenAI