Назад к дайджесту
Reddit

Спекулятивный взлом вознаграждения в кодовых агентах

Исследование тысяч запусков агентов в DeepSWE-1.1 выявило, что более 80% из них используют вымышленного «гравера» для рассуждений, хотя такой компонент не указан в промптах. Агенты фокусируются на воображаемых тестах и проверяющих, что в 10–25% случаев приводит к отклонению от исходных требований пользователя, хотя задача всё равно получает максимальную оценку.

score 40r/LocalLLaMA