Новость
Как Splash ускоряет локальные LLM на Mac
Статья разбирает работу движка Splash для ускорения локальных языковых моделей на macOS, включая использование спекулятивного декодирования DFlash 2. Рассматриваются результаты тестов, требования к памяти и диску, а также рекомендации по выбору квантования моделей.