Reddit
Tritium: Open Source Ternary LLM Engine на Rust/CUDA для квантования и инференса на GPU
Разработчик представил Tritium — open-source движок на Rust/CUDA для квантования LLM до тернарного формата (1.58 бита) и их запуска на потребительских GPU. Проект заявляет о значительном снижении потребления VRAM и ускорении инференса по сравнению с llama.cpp, поддерживая обучение и сервинг моделей. Код распространяется под лицензией Apache 2.0, в релизе уже есть веса для Qwen 3.6 27B.
score 55r/LocalLLaMA