Назад к дайджесту
Reddit

Нативная поддержка GGUF в transformers!

Hugging Face объявил о нативной поддержке GGUF-квантованных моделей (llama.cpp quants) в библиотеке transformers. Теперь их можно загружать через стандартный API, что упрощает отладку, оценку и кастомную генерацию. На Apple Silicon используются ggml-ядра, производительность сопоставима с llama.cpp.

score 40r/LocalLLaMA