Reddit
Малые языковые модели и квантование: почему лаборатории не используют QAT?
Автор задаётся вопросом, почему разработчики малых языковых моделей (SLM) оптимизируют размер, но игнорируют квантование при обучении (QAT). Отмечается, что квантованная большая модель (например, Bonsai 27B Q8) может превзойти малую полноформатную модель при сопоставимых требованиях к памяти.
score 40r/LocalLLaMA