Reddit
Запуск огромных MoE-моделей на обычных смартфонах: я думал, что это прорыв, но...
Разработчик представил open-source проект bigedgeonmoe для запуска MoE-моделей (Qwen 35B–120B) на мобильных устройствах и ПК через CPU. Проект обеспечивает скорость 6 токенов/сек на среднем смартфоне и совместим с любыми архитектурами llama.cpp. Это решение позволяет выполнять инференс больших языковых моделей без специализированных GPU.
score 40r/AI_Agents