Reddit
llama.cpp: пул-реквест даёт прирост скорости инференса на 8%
Пул-реквест для llama.cpp переносит сэмплирование с CPU на GPU, обеспечивая прирост скорости до 8% на RTX 5090 и 4% на старых GPU вроде Tesla P40. Оптимизация особенно эффективна на видеокартах с высокой пропускной способностью памяти, при этом соотношение акцептации токенов остаётся неизменным.
score 55r/LocalLLaMA