Назад к дайджесту
Reddit

Можно ли ещё ускорить генерацию? RTX 4060 Ti 16GB, 32GB ОЗУ

Пользователь спрашивает совета по оптимизации скорости инференса локальной LLM Qwen 3.8 27B на связке RTX 4060 Ti 16GB и 32GB системной памяти. Он использует llama.cpp с квантованными моделями (IQ3_S для основной, Q4_K_M для драфта) и спекулятивным декодированием, достигая 6-7 ток/с на рассуждениях и 11 ток/с на генерации кода. Ищет способы улучшить производительность, учитывая большой контекст (128K).

score 40r/LocalLLaMA