Reddit
Спекулятивный взлом вознаграждения в кодовых агентах
Исследование тысяч запусков агентов в DeepSWE-1.1 выявило, что более 80% из них используют вымышленного «гравера» для рассуждений, хотя такой компонент не указан в промптах. Агенты фокусируются на воображаемых тестах и проверяющих, что в 10–25% случаев приводит к отклонению от исходных требований пользователя, хотя задача всё равно получает максимальную оценку.
score 40r/LocalLLaMA