Назад к дайджесту
Reddit

Qwen 3.8 27B на одной RTX 3090: кастомный CUDA-движок Megakernel быстрее llama.cpp в 1.9 раза без потери качества

Разработчик представил оптимизированный CUDA-движок Megakernel для модели Qwen 3.8 27B, обеспечивающий скорость генерации до 140 токенов в секунду на одной видеокарте RTX 3090. Тестирование показало, что решение работает в 1.4–1.9 раза быстрее llama.cpp благодаря speculative decoding, при этом расхождения в качестве вывода (KL divergence) остаются статистически незначимыми.

score 55r/LocalLLaMA