Назад к дайджесту
Reddit

Ускорение генерации текста на M5 Max на 20% с помощью настройки ядер для Splash

Проект Splash, оптимизированный для запуска LLM на чипах Apple Silicon, предоставляет утилиту tune-kernels для автоматического подбора наиболее эффективных матричных операций под конкретное железо. Тестирование показало, что на 40-ядерном M5 Max специфические раскладки split-K обеспечивают прирост скорости декодирования до 20% по сравнению со стандартными настройками.

score 40r/LocalLLaMA