Reddit
Модели Luna и Sol отлично справляются с новым бенчмарком по поиску багов до их появления у пользователей
Исследователи из Meta, Стэнфорда и Гарварда представили новый открытый бенчмарк SWE-sweep, оценивающий способность агентов находить и исправлять реальные ошибки в кодовых базах до того, как они станут заметны пользователям. В тесте лидируют модели Luna и Sol, при этом Luna демонстрирует высокую эффективность по соотношению стоимости и качества по сравнению с моделями Anthropic.
score 40r/OpenAI