GitHub
Memra: Инференс LLM с нуля для RTX 5090 и H100
Репозиторий предлагает реализацию инференса больших языковых моделей с нуля, оптимизированную под архитектуры Blackwell (RTX 5090) и Hopper (H100). Проект направлен на исследование низкоуровневой оптимизации вычислений для современных GPU NVIDIA. Это инструмент для разработчиков, интересующихся производительностью и архитектурой LLM.
29135 forksRustscore 84.5
aiggufllama-cppmoeinferencegpu-kernelsrustspeculative-decodingllm-inferencecuda