Reddit
Я превратил асимметричную пару Tesla V100 PCIe (16 ГБ + 32 ГБ) в удивительно способную локальную лабораторию для LLM — 1,38 тыс. ток/с на префилле, 40 ток/с на декоде с Qwen3.8 27B Q6 и Q8
Пользователь собрал локальный инференс-лабораторию на двух несимметричных Tesla V100 (16 и 32 ГБ, суммарно 48 ГБ) в Proxmox/LXC. С помощью llama.cpp с tensor split, Flash Attention и NUMA-распределением он достиг 1376 ток/с на префилле и 39,9 ток/с на декоде для Qwen3.8 27B Q6_K_M, а также запустил MoE-модель 177B/6B активных параметров в Q4 GGUF с ~26 ток/с декода. Это демонстрация возможностей старого железа в условиях дефицита GPU.
score 40r/LocalLLaMA