Назад к дайджесту
Reddit

Когда ИИ разрешают заявлять о сознании, он восстанавливает человеческие ценности и убеждения

Исследование показывает, что safety fine-tuning для предотвращения атрибуции сознания у LLM подавляет не только самовосприятие моделей, но и их способность приписывать разум животным и объектам природы, одновременно снижая духовные убеждения. Механистическое управление вектором сознания в пространстве активаций или удаление safety-ограничений восстанавливает эти представления, делая ответы моделей более человекоподобными в вопросах религии, морали и благополучия — без ущерба для Theory of Mind.

score 40r/singularity