Reddit
Собранная из LLM-агентов команда превзошла Cursor и CodeRabbit в тесте на ревью кода
Автор протестировал самодельную команду из трёх агентов на базе модели GPT-5.5 с разными ролями на бенчмарке из 50 PR. Используя метод консенсуса (повтор 3 раза), команда показала F1 0.463, обойдя Cursor Bugbot и CodeRabbit.
score 40r/AI_Agents