Назад к дайджесту
GitHub

llamAmpere: форк llama.cpp для оптимизации на GPU Ampere

Представлен форк библиотеки llama.cpp, специально оптимизированный для архитектур NVIDIA Ampere, таких как RTX 3090 и 3090 Ti. Решение включает использование TurboQuant для кэша KV, спекулятивное декодирование MTP с коротким словарем и пользовательские ядра SM86, что позволяет достигать скорости 90 токенов в секунду при генерации длинных контекстов.

11716 forksC++score 85.5
llama-cppmtpggufkv-cache-quantizationlong-contextamperespeculative-decodingcudaconsumer-gpumulti-token-prediction