Назад к дайджесту
Reddit

Автоматическое планирование тензоров для гибридного CPU-GPU вывода LLM на потребительских устройствах

Авторы предлагают систему ATSInfer для запуска LLM на устройствах с ограниченной видеопамятью, используя гибридный CPU-GPU инференс. В отличие от существующих методов, система управляет отдельными тензорами, что позволяет динамически балансировать нагрузку и ускорять генерацию в 3.29 раза. Решение демонстрирует значительный прирост производительности и утилизации ресурсов на потребительском железе.

score 55r/LocalLLaMA