Reddit
Высокая скорость работы Qwen3.8 с ExLlamaV3 и Hermes
Пользователь демонстрирует работу модели Qwen3.8 (6bpw) через движок ExLlamaV3 от Turboderp на конфигурации из шести GPU RTX 3090, достигая скорости 80-120 токенов в секунду. Интеграция с агентом Hermes позволяет безопасно управлять ИИ-инструментами, включая кодинг-агенты, через протокол Matrix.
score 55r/LocalLLaMA