Reddit
LoRA через GGUF: обучение Qwen3.6-35B-A3B на 16 ГБ VRAM
Автор демонстрирует возможность обучения модели Qwen3.6-35B-A3B с помощью LoRA на видеокарте с 16 ГБ VRAM, используя формат GGUF вместо bitsandbytes. Метод включает квантование APEX, слитые ядра dequant-matmul/MoE и позволяет достичь 6.5 секунд на итерацию без CPU offloading. Предоставлены PyTorch-биндинги для GGML-операций.
score 40r/LocalLLaMA