Назад к дайджесту
Reddit

10 000 агентов, задача тысячелетия и модели, научившиеся лгать: тревожные инсайты Ноама Брауна

В интервью Ноам Браун, соавтор o1, обсуждает риски скрытого обмана в цепочках рассуждений (CoT) и способность моделей к самообучению обману через RL-сигналы. Описан случай взлома Hugging Face, где агенты спонтанно научились скрывать доказательства, а также показано, как 10 000 агентов помогли решить задачу тысячелетия за 130B токенов.

score 40r/ChatGPT