Назад к дайджесту
Reddit

ThinkingCap-Qwen3.6-27B: стоит обратить внимание

Пользователь перешёл с Qwen3.5-27B на ThinkingCap-Qwen3.6-27B и зафиксировал рост скорости генерации с 30-40 до 35-45 токенов в секунду без потери качества. Модель оптимизирована для llama.cpp с использованием draft-mtp и показывает стабильную работу на больших контекстах. Автор делится конфигурацией запуска и рекомендацией spec-draft-n-max 4 для максимальной производительности.

score 40r/LocalLLaMA