Reddit
Ускорение генерации текста на M5 Max на 20% с помощью настройки ядер для Splash
Проект Splash, оптимизированный для запуска LLM на чипах Apple Silicon, предоставляет утилиту tune-kernels для автоматического подбора наиболее эффективных матричных операций под конкретное железо. Тестирование показало, что на 40-ядерном M5 Max специфические раскладки split-K обеспечивают прирост скорости декодирования до 20% по сравнению со стандартными настройками.
score 40r/LocalLLaMA