Reddit
Есть ли смысл использовать MLX в сентябре 2026?
Пользователь сравнивает производительность MLX и llama.cpp для запуска LLM (Qwen3.8 27b) на Apple M5. После обновления llama.cpp с поддержкой Neural Engine префилл достиг 300+ токенов/сек, что ставит под вопрос необходимость MLX для локального инференса.
score 40r/LocalLLaMA