Reddit
В llama.cpp добавлена поддержка CUDA для запуска модели Ternary-Bonsai-8B-Q2_0.gguf
В библиотеку llama.cpp добавлена поддержка CUDA для запуска модели Ternary-Bonsai-8B-Q2_0.gguf. Обновление позволяет использовать ускорение на GPU для специфического формата квантования с тернарными весами.
score 55r/LocalLLaMA