Назад к дайджесту
Reddit

Бенчмарки: TensorSharp против llama.cpp

Разработчик представил новый движок инференса LLM на C# — TensorSharp, сравнив его производительность с популярным llama.cpp. Тесты на CUDA и Vulkan показывают сопоставимые или лучшие результаты для моделей Gemma и Qwen. Проект реализует инференс с нуля, а не является обёрткой, и поддерживает различные бэкенды.

score 55r/LocalLLaMA