Reddit
Разгон DDR5 для ускорения префилла и декодирования MoE-моделей
Автор тестирует влияние разгона оперативной памяти DDR5 с 3600 до 4800 МГц на производительность MoE-моделей в llama.cpp, когда модель не помещается в VRAM. Разгон обеспечил рост пропускной способности памяти на 36%, что привело к увеличению скорости префилла (PP) на 10% и генерации токенов (TG) на 5%. Эффект особенно заметен при работе с длинными контекстами.
score 40r/LocalLLaMA