Назад к дайджесту
Reddit

Как запустить Qwen 2.5-3.8B Flash с длинным контекстом на слабом железе?

Пользователь спрашивает о конфигурации для запуска модели Qwen 2.5-3.8B Flash на GPU с 12 ГБ VRAM и 32 ГБ ОЗУ. Вопрос касается выбора инференс-фреймворка (harness) и настроек для достижения высокой скорости генерации токенов при работе с большим контекстом.

score 40r/LocalLLaMA