Назад к дайджесту
Новость

Как Splash ускоряет локальные LLM на Mac

Статья разбирает работу движка Splash для ускорения локальных языковых моделей на macOS, включая использование спекулятивного декодирования DFlash 2. Рассматриваются результаты тестов, требования к памяти и диску, а также рекомендации по выбору квантования моделей.