Reddit
Nonobench: открытый бенчмарк для 49 LLM на задачах нонграмм
Представлен открытый бенчмарк Nonobench, оценивающий способность 49 языковых моделей решать логические головоломки нонграммы (picross) без использования внешних инструментов. Исследование показывает резкое падение точности с ростом сложности сетки и выявляет ограничения моделей в поддержании логического контекста при решении задач высокой сложности.
score 55r/MachineLearning