Reddit
GLM-5.2 и ik_llama.cpp: критический баг при длинном контексте
Пользователь сообщает о фатальном сбое при запуске GLM-5.2 через llama.cpp: генерация работает стабильно на 8k контекста, но падает с NaN-логитами при увеличении до 32k+. Несмотря на отладку параметров кэша и вычислений, проблема сохраняется, что указывает на возможное переполнение в GPU-пути DSA-индексатора. Автор ищет подтверждение известной проблемы или обходной путь для работы с полной ёмкостью контекста модели.
score 55r/LocalLLaMA