Reddit
llama.cpp: добавлена поддержка тензорного параллелизма через RPC
В проект llama.cpp внесён крупный апстрим, позволяющий запускать модели на нескольких компьютерах с использованием тензорного параллелизма. Функционал реализован через механизм RPC, что открывает возможности для распределённого инференса без необходимости локального доступа к GPU всех узлов.
score 55r/LocalLLaMA