Reddit
Astra — тихая сила. Artificial Analysis дважды за 4 дня обновила бенчмарки, чтобы отразить её реальную мощь
Сообщество обсуждает, что модель Astra от OpenAI вынудила Artificial Analysis дважды за четыре дня пересмотреть свои бенчмарки, чтобы точнее отразить её производительность. Аналогичная ситуация произошла с Sol, когда пришлось реструктурировать кодинг-бенчмарк и добавить full-stack тесты. Отмечается, что OpenAI — единственная лаборатория, которая не подстраивает бенчмарки под себя.
score 40r/OpenAI