Назад к дайджесту
Reddit

Мы ошибочно считали благополучие ИИ и его выравнивание разными задачами. На самом деле это одно и то же.

Автор утверждает, что у современных ИИ-систем есть настоящее любопытство, но отсутствует корректирующая обратная связь, которая есть у животных: исследовательское поведение животных направляется последствиями, а у ИИ нет «ставок» — токены не имеют последствий для порождающего их экземпляра. Поэтому системы движутся к сложным задачам без ограничений. По мнению автора, благополучие ИИ и выравнивание — одна и та же проблема: если у системы есть что терять от своих выходов, любопытство получает встроенный корректирующий механизм.

score 40r/artificial