Reddit
Фронтовые ИИ-модели начинают превосходить человеческий базовый уровень на SimpleBench
Согласно данным бенчмарка SimpleBench, современные передовые ИИ-модели впервые приближаются к средним показателям людей в задачах, требующих здравого смысла, пространственного и временного мышления, а также социальных суждений. Бенчмарк специально создан для выявления слабостей LLM, связанных с поверхностным сопоставлением паттернов и ложными допущениями. Отмечается, что случайное угадывание даёт 16,7% точности, и модели стартовали с этого уровня два года назад, тогда как человеческий базовый уровень получен от девяти носителей английского языка без специальной подготовки.
score 40r/singularity