Назад к дайджесту
Reddit

llama.cpp: добавлена поддержка тензорного параллелизма через RPC

В проект llama.cpp внесён крупный апстрим, позволяющий запускать модели на нескольких компьютерах с использованием тензорного параллелизма. Функционал реализован через механизм RPC, что открывает возможности для распределённого инференса без необходимости локального доступа к GPU всех узлов.

score 55r/LocalLLaMA