Reddit
Для владельцев трёх RTX 3090: я нашёл оптимальную локальную модель
Автор, запускающий локальные LLM на трёх RTX 3090, делится опытом. Он долго использовал Qwen 3.8 27B в квантовании UD-Q8_K_L на двух картах, но недавно попробовал Qwen 3.8 Flash Next в UD-Q4_K_XL на трёх картах. Несмотря на низкую скорость генерации и выгрузку части слоёв в RAM, качество вывода его поразило — особенно на собственном тесте с Flappy Bird.
score 40r/LocalLLaMA