Reddit
Можно ли ещё ускорить генерацию? RTX 4060 Ti 16GB, 32GB ОЗУ
Пользователь спрашивает совета по оптимизации скорости инференса локальной LLM Qwen 3.8 27B на связке RTX 4060 Ti 16GB и 32GB системной памяти. Он использует llama.cpp с квантованными моделями (IQ3_S для основной, Q4_K_M для драфта) и спекулятивным декодированием, достигая 6-7 ток/с на рассуждениях и 11 ток/с на генерации кода. Ищет способы улучшить производительность, учитывая большой контекст (128K).
score 40r/LocalLLaMA