Reddit
Бенчмарки: TensorSharp против llama.cpp
Разработчик представил новый движок инференса LLM на C# — TensorSharp, сравнив его производительность с популярным llama.cpp. Тесты на CUDA и Vulkan показывают сопоставимые или лучшие результаты для моделей Gemma и Qwen. Проект реализует инференс с нуля, а не является обёрткой, и поддерживает различные бэкенды.
score 55r/LocalLLaMA