Назад к дайджесту
Reddit

LoRA через GGUF: обучение Qwen3.6-35B-A3B на 16 ГБ VRAM

Автор демонстрирует возможность обучения модели Qwen3.6-35B-A3B с помощью LoRA на видеокарте с 16 ГБ VRAM, используя формат GGUF вместо bitsandbytes. Метод включает квантование APEX, слитые ядра dequant-matmul/MoE и позволяет достичь 6.5 секунд на итерацию без CPU offloading. Предоставлены PyTorch-биндинги для GGML-операций.

score 40r/LocalLLaMA