GitHub
llamAmpere: форк llama.cpp для оптимизации на GPU Ampere
Представлен форк библиотеки llama.cpp, специально оптимизированный для архитектур NVIDIA Ampere, таких как RTX 3090 и 3090 Ti. Решение включает использование TurboQuant для кэша KV, спекулятивное декодирование MTP с коротким словарем и пользовательские ядра SM86, что позволяет достигать скорости 90 токенов в секунду при генерации длинных контекстов.
11716 forksC++score 85.5
llama-cppmtpggufkv-cache-quantizationlong-contextamperespeculative-decodingcudaconsumer-gpumulti-token-prediction