Reddit
Модельный графтинг: превращение Qwen3.5-4B в причинный энкодер-декодер постфактум
Метод Model Grafting позволяет превратить существующую модель в причинный энкодер-декодер без обучения с нуля. Он применён к Qwen3.5-4B: модель разрезается, нижние слои читают промпт, верхние используются как энкодер через identity-init адаптеры, после чего модель восстанавливается self-distillation от родителя. Созданы два варианта: graft8 с ускорением ~3.7x на 128K промпте при некоторой потере точности и graft16 с ускорением 2.0x и минимальной потерей точности.
score 40r/LocalLLaMA