Назад к дайджесту
Reddit

ExLlamaV3 недооценён

Пользователь Reddit делится восторгом от ExLlamaV3 — движка для локального запуска LLM, который, по его словам, даёт кванты более высокого качества при том же размере, быстрее работает и имеет более низкие метрики KLD по сравнению с llama.cpp. Автор отмечает недавнее добавление CPU MoE offload и рекомендует попробовать инструмент, используя его с бэкендом tabbyAPI и моделями Qwen.

score 55r/LocalLLaMA