Reddit
Swift 1.5 + HyperQwen: ускорение генерации на 37% при работе с контекстом 150k на RTX 3090
Автор объединил технику квантования HyperQwen с моделями Swift 1.5, достигнув снижения времени выполнения задач на 37% по сравнению со стандартным быстрым квантованием W4A16. Решение позволяет обрабатывать контекст до 150k токенов на видеокарте RTX 3090 24GB, сохраняя высокое качество ответов и высокую скорость декодирования.
score 40r/LocalLLaMA