Назад к дайджесту
Reddit

Это хорошо? 262k Qwen3.8:27B-Q4_K_M

Пользователь реализовал поддержку NVFP4 KV cache в гетерогенном порте ветки ollama, отредактировав llama.cpp и написав кастомные CUDA-ядра. Он разделяет модель Qwen3.8:27B между RTX 5090 и RTX 3090 Ti с учётом вычислительных возможностей, а также самостоятельно квантует модель в Q4_K_M. В результате удалось добиться работы с контекстом 262k токенов, исправив баги с переполнением на границах TILE и выравниванием загрузки векторов.

score 40r/LocalLLaMA