Назад к дайджесту
Reddit

Apple M5 пока не использует на полную мощность свои матричные ядра

Автор продемонстрировал, что чипы Apple M5 поддерживают INT8-активации, но популярные фреймворки вроде MLX и Llama.cpp пока используют только 16-бит. Написанные вручную ядра w8a8 обеспечили прирост скорости на 1.4x для задач Gemma4. Это указывает на скрытый потенциал для оптимизации локального запуска LLM на Mac.

score 40r/LocalLLaMA