Reddit
Помогите разобраться с размером GGUF и контекстом
Пользователь спрашивает, как оптимально распределить модель Qwen3.8 27B в формате GGUF между двумя видеокартами по 16 ГБ, учитывая, что встроенная графика обслуживает монитор. Он рассматривает варианты загрузки модели на одну карту и контекста на другую, либо использование тензорного параллелизма для более высоких квантований. Также интересуется, как рассчитать объём VRAM, занимаемый контекстом (например, 132k токенов), поскольку эта информация редко публикуется в карточках моделей.
score 40r/LocalLLaMA