Reddit
Дистилляция LLM в два легких энкодера (GLiNER + multiple choice) для извлечения данных из документов: почему результат хуже учителя?
Автор делится опытом дистилляции большой языковой модели в два легких энкодера (GLiNER и multiple choice) для структурирования 5 миллионов судебных решений. Несмотря на использование строгой схемы JSON и многоэтапной разметки, производительность малых моделей не достигла уровня исходной LLM, что вызывает вопросы о правильности выбранного подхода.
score 40r/LocalLLaMA