Reddit
ThinkingCap-Qwen3.6-27B: стоит обратить внимание
Пользователь перешёл с Qwen3.5-27B на ThinkingCap-Qwen3.6-27B и зафиксировал рост скорости генерации с 30-40 до 35-45 токенов в секунду без потери качества. Модель оптимизирована для llama.cpp с использованием draft-mtp и показывает стабильную работу на больших контекстах. Автор делится конфигурацией запуска и рекомендацией spec-draft-n-max 4 для максимальной производительности.
score 40r/LocalLLaMA