Reddit
Инструмент InferBench: как современные LLM понимают истинные цели пользователя
Представлен новый бенчмарк InferBench, оценивающий способность передовых языковых моделей выводить приоритеты пользователя из инструкций. Тестирование 12 моделей показало, что при явных указаниях точность достигает 89%, но падает до 60% при скрытых предпочтениях, при этом модели часто сохраняют высокую уверенность в ошибочных решениях.
score 40r/LocalLLaMA