Reddit
Java-фреймворк vllm-подобного типа заявляет 90% производительности llama.cpp на локальном инференсе NVIDIA GPU за счёт компиляции Java в CUDA и cuTile
Проект TornadoVM и движок jitLLM позволяют компилировать Java-код в CUDA и cuTile для ускорения локального инференса LLM на видеокартах NVIDIA. Разработчики утверждают, что достигают 90% от производительности llama.cpp, что открывает новые возможности для использования Java в задачах генеративного ИИ.
score 55r/LocalLLaMA