GitHub
arizqi/cpubrrr: инференс Frontier LLM на CPU
Разработчик создал библиотеку cpubrrr на Rust с кастомными NEON/SME ядрами, позволяющую запускать модели уровня Frontier на CPU ноутбука без GPU. На Apple M4 Max достигается скорость ~110 токенов в секунду для gpt-oss:20b, что в 7.5 раза быстрее стандартного llama.cpp. Это решение значительно упрощает локальный инференс больших языковых моделей на потребительском оборудовании.
525 forksRustscore 80.2
mixture-of-expertsquantizationinferenceapple-siliconrustsimdllmcpuneongpt-oss