Reddit
Конфигурация и тесты Qwen 27B на двух 5070ti
Пост о запуске языковой модели Qwen 27B на двух GPU 5070ti с оптимизацией KV-кэша через VLLM. Показаны метрики производительности: 87-94 токена/сек при декодировании, поддержка контекста до 120k, возможность параллельной работы двух потоков без потери скорости — подходит для локальных агентных задач.
score 40r/LocalLLaMA