Reddit
Сравнение производительности: переход с трех RTX 3090 на две RTX 5090 для локальных LLM
Автор делится результатами апгрейда домашнего сервера с трех видеокарт RTX 3090 на две RTX 5090 для запуска модели Qwen3.8-27B. Отмечается значительный прирост скорости инференса благодаря аппаратной поддержке формата NVFP4 и использованию speculative decoding в llama.cpp.
score 40r/LocalLLaMA