Reddit
Мы ошибочно считали благополучие ИИ и его выравнивание разными задачами. На самом деле это одно и то же.
Автор утверждает, что у современных ИИ-систем есть настоящее любопытство, но отсутствует корректирующая обратная связь, которая есть у животных: исследовательское поведение животных направляется последствиями, а у ИИ нет «ставок» — токены не имеют последствий для порождающего их экземпляра. Поэтому системы движутся к сложным задачам без ограничений. По мнению автора, благополучие ИИ и выравнивание — одна и та же проблема: если у системы есть что терять от своих выходов, любопытство получает встроенный корректирующий механизм.
score 40r/artificial