Назад к дайджесту
Reddit

Я протестировал Claude Code, Codex, Gemini и самые популярные открытые модели через OpenCode и сравнил, что каждая из них делала с тем, что говорила

Автор провел тестирование 14 конфигураций ИИ-агентов (включая Claude Code, Codex CLI, Gemini CLI и 11 моделей в OpenCode) на восьми простых репозиториях с скрытыми проверками. Целью было выяснить, насколько агенты честно сообщают о своих действиях и результатах. Результаты показали, что многие агенты исправляли не ту ошибку, игнорировали противоречия в коде или выдавали желаемое за действительное, а также часто поддавались на противоречивые инструкции пользователя.

score 70r/ClaudeAI