Reddit
Кто сравнивал pre-training, SFT/LoRA и дообучение с подкреплением на Qwen3.6-27B?
Автор спрашивает сообщество о сравнении методов дообучения Qwen3.6-27B: SFT, LoRA и RL-пост-тренинг. Обсуждение опирается на свежие исследования о катастрофическом забывании и сохранении способностей модели при разных стратегиях. Пользователи делятся бенчмарками и параметрами, чтобы понять, какой подход лучше сохраняет навыки в коде, рассуждениях и знании контекста.
score 40r/LocalLLaMA