Reddit
Оптимизация обработки промптов в llama.cpp: ускорение на 5.5% для моделей Qwen
Разработчик SongXiaoXi предложил изменение в библиотеке ggml-cuda, позволяющее назначать четыре столбца состояния GDN на каждый warp. Это техническое улучшение в рамках pull request #30087 для проекта llama.cpp обеспечивает прирост производительности обработки промптов (prompt processing) на 5.3–5.5% для моделей серии Qwen 3.x без значительного влияния на скорость генерации текста.
score 55r/LocalLLaMA