Назад к дайджесту
Новость

Последствия лингвистической нечитаемости для безопасности LLM

Авторы вводят понятие лингвистической нечитаемости: внешние языковые выходы LLM и механически извлечённые лингвистические признаки могут не отражать реальные внутренние вычисления модели. Это ставит под сомнение механизмы безопасности, полагающиеся на языковые самоотчёты, такие как мониторинг цепочки рассуждений или конституционная самокритика. В качестве решения предлагается отслеживание потока данных (taint tracking) и другие методы изоляции, не зависящие от чтения языкового состояния модели.