Назад к дайджесту
Reddit

laya.cpp: оптимизированный почти мгновенный вывод Laya

laya.cpp — это быстрая C++-реализация инференса модели Laya на базе ggml с кастомными CUDA-ядрами. Она поддерживает все три чекпоинта (английский, многоязычный и typed-decisions) и не требует Python или PyTorch. Оптимизации позволили значительно ускорить обработку запросов по сравнению с Python-версией.

score 40r/LocalLLaMA