Назад к дайджесту
Новость

Сжатие LLaMA-7B до 1 ГБ без дообучения: итоги 60+ экспериментов

Автор попытался ужать веса LLaMA-7B с 13 ГБ до 1 ГБ без дообучения, дистилляции и pruning, используя только математические преобразования и калибровочные тексты. В ходе более 60 экспериментов выяснилось, что достичь 1 ГБ с качеством Q8 не удалось: текущий артефакт занимает 2.05 GiB и уступает обычной Q3_K_M по качеству и скорости. Однако автор обнаружил, что можно заметно улучшить восстановление отдельных весов, но при этом модель становится глупее в целом.