Reddit
Автоматическое планирование тензоров для гибридного CPU-GPU вывода LLM на потребительских устройствах
Авторы предлагают систему ATSInfer для запуска LLM на устройствах с ограниченной видеопамятью, используя гибридный CPU-GPU инференс. В отличие от существующих методов, система управляет отдельными тензорами, что позволяет динамически балансировать нагрузку и ускорять генерацию в 3.29 раза. Решение демонстрирует значительный прирост производительности и утилизации ресурсов на потребительском железе.
score 55r/LocalLLaMA