Reddit
Смогут ли LLM пройти лабиринт?
Автор создал экспериментальный бенчмарк для оценки пространственного мышления и памяти языковых моделей. Задача требует от ИИ ориентироваться в лабиринте, получая только текстовое описание ближайшего окружения, без полной карты. В тесте участвовали модели GPT-5.4 mini, GLM-5.2 и K2.6, где только последняя смогла эффективно найти выход.
score 40r/LocalLLaMA