Назад к дайджесту
Новость

Оптимизация Qwen3.8-27B на двух RTX 3060: ускорение OpenCode до 40 токенов/с

Автор описывает процесс настройки локального бэкенда для модели Qwen3.8-27B на базе двух видеокарт RTX 3060 12 ГБ. С применением техник вроде разделения тензоров без CUDA P2P, квантования KV-кэша и настройки параметров контекста удалось увеличить скорость генерации с 9 до 40 токенов в секунду при работе с длинным контекстом в 128K.