Reddit
Новый PR llama.cpp: ускорение ROCm на 15% и исправление бага с Q2_K
В библиотеку llama.cpp добавлен пул-реквест, оптимизирующий работу с AMD ROCm и повышающий скорость обработки промптов на 15%. Также исправлена критическая ошибка, из-за которой квантование Q2_K работало в 28 раз медленнее, что делает экстремальные квантования более жизнеспособными на видеокартах AMD.
score 55r/LocalLLaMA