Reddit
Qwen 3.8 27B на одной RTX 3090: кастомный CUDA-движок Megakernel быстрее llama.cpp в 1.9 раза без потери качества
Разработчик представил оптимизированный CUDA-движок Megakernel для модели Qwen 3.8 27B, обеспечивающий скорость генерации до 140 токенов в секунду на одной видеокарте RTX 3090. Тестирование показало, что решение работает в 1.4–1.9 раза быстрее llama.cpp благодаря speculative decoding, при этом расхождения в качестве вывода (KL divergence) остаются статистически незначимыми.
score 55r/LocalLLaMA