Reddit
Нативная поддержка GGUF в transformers!
Hugging Face объявил о нативной поддержке GGUF-квантованных моделей (llama.cpp quants) в библиотеке transformers. Теперь их можно загружать через стандартный API, что упрощает отладку, оценку и кастомную генерацию. На Apple Silicon используются ggml-ядра, производительность сопоставима с llama.cpp.
score 40r/LocalLLaMA