GitHub
Структурное прунинг LLM во время инференса на основе связи представлений и параметров
Исследование, принятое на конференцию ICML 2026, предлагает метод структурированного сокращения языковых моделей непосредственно в процессе инференса. Подход основан на связывании представлений данных с параметрами модели через зондирование, что позволяет эффективно отсекать ненужные компоненты без переобучения.
300 forksPythonscore 63.1
trainingfreeinferencetimeicml2026pruningllmcompression