Назад к дайджесту
Reddit

Собранная из LLM-агентов команда превзошла Cursor и CodeRabbit в тесте на ревью кода

Автор протестировал самодельную команду из трёх агентов на базе модели GPT-5.5 с разными ролями на бенчмарке из 50 PR. Используя метод консенсуса (повтор 3 раза), команда показала F1 0.463, обойдя Cursor Bugbot и CodeRabbit.

score 40r/AI_Agents