Назад к дайджесту
Новость

Оптимизация MoE-моделей на слабом железе: опыт ускорения llama.cpp на GTX 1660 SUPER

Автор делится опытом оптимизации форка llama.cpp для запуска больших MoE-моделей (gpt-oss-20b) на домашнем ПК с видеокартой на 6 ГБ. Несмотря на то, что собственные улучшения не превзошли штатный флаг -fit, статья содержит ценные наблюдения о методах замера производительности и настройки для владельцев ограниченного GPU.