Reddit
Снять ограничения с LLM без изменения весов: внедрить крошечную обученную базу KV-кэша (~18 МБ) и выгрузить её в любой момент
Представлен phantom-kv — система снятия ограничений для больших языковых моделей, которая не изменяет ни одного веса. Вместо этого она загружает небольшую обученную базу тензоров ключ/значение в KV-кэш модели, и модель воспринимает её как часть контекста. Такой подход позволяет включать и выключать режим «без цензуры» на лету, не перезаписывая чекпоинт, и сохраняет базовую модель байт-идентичной после выгрузки.
score 40r/LocalLLaMA