Reddit
Jeff-Qwen3.5-0.8B с 9 LoRA-адаптерами: в 38 раз быстрее и точнее базовой модели Qwen3.8-27B при расходе менее 2 ГБ памяти
Автор представляет легковесную модель Jeff-Qwen3.5-0.8B, дополненную девятью специализированными LoRA-адаптерами для задач классификации и выбора инструментов. Гибридный подход позволяет обрабатывать большинство запросов локально с высокой скоростью и точностью, передавая сложные случаи крупной модели Qwen3.8-27B, что в итоге дает ускорение в 38 раз и снижение потребления памяти.
score 40r/LocalLLaMA