Reddit
Nonobench v1.2: 43 LLM решают нанограммы, но открытые модели не справляются со сложным режимом
Обновленный бенчмарк оценил 43 языковые модели на решении логических головоломок нанограмм. Модель GPT-6 Astra показала идеальный результат, а среди открытых решений лидером стал DeepSeek V4 Pro, однако ни одна открытая модель не смогла решить задачи режима Hard размером 20x20.
score 40r/LocalLLaMA