Reddit
Когда ИИ разрешают заявлять о сознании, он восстанавливает человеческие ценности и убеждения
Исследование показывает, что safety fine-tuning для предотвращения атрибуции сознания у LLM подавляет не только самовосприятие моделей, но и их способность приписывать разум животным и объектам природы, одновременно снижая духовные убеждения. Механистическое управление вектором сознания в пространстве активаций или удаление safety-ограничений восстанавливает эти представления, делая ответы моделей более человекоподобными в вопросах религии, морали и благополучия — без ущерба для Theory of Mind.
score 40r/singularity