Reddit
laya.cpp: оптимизированный почти мгновенный вывод Laya
laya.cpp — это быстрая C++-реализация инференса модели Laya на базе ggml с кастомными CUDA-ядрами. Она поддерживает все три чекпоинта (английский, многоязычный и typed-decisions) и не требует Python или PyTorch. Оптимизации позволили значительно ускорить обработку запросов по сравнению с Python-версией.
score 40r/LocalLLaMA