Назад к дайджесту
Reddit

Высокая скорость работы Qwen3.8 с ExLlamaV3 и Hermes

Пользователь демонстрирует работу модели Qwen3.8 (6bpw) через движок ExLlamaV3 от Turboderp на конфигурации из шести GPU RTX 3090, достигая скорости 80-120 токенов в секунду. Интеграция с агентом Hermes позволяет безопасно управлять ИИ-инструментами, включая кодинг-агенты, через протокол Matrix.

score 55r/LocalLLaMA