Новость
Глобальное рабочее пространство в языковых моделях
Исследователи Anthropic применили теорию глобального рабочего пространства для анализа внутренних состояний LLM. Статья описывает методы выявления паттернов, активирующихся при «мышлении» модели, что помогает обнаруживать обман и понимать истинные намерения нейросети. Это перевод ключевого материала по интерпретируемости больших языковых моделей.