Назад к дайджесту
Reddit

Кто сравнивал pre-training, SFT/LoRA и дообучение с подкреплением на Qwen3.6-27B?

Автор спрашивает сообщество о сравнении методов дообучения Qwen3.6-27B: SFT, LoRA и RL-пост-тренинг. Обсуждение опирается на свежие исследования о катастрофическом забывании и сохранении способностей модели при разных стратегиях. Пользователи делятся бенчмарками и параметрами, чтобы понять, какой подход лучше сохраняет навыки в коде, рассуждениях и знании контекста.

score 40r/LocalLLaMA