Reddit
Статические LLM-бенчмарки могут упускать изменения производительности со временем — наблюдения из 31 352 повторных измерений
Публичные бенчмарки LLM показывают производительность модели на момент тестирования, но не отражают её изменения в последующие дни или недели. Анализ 31 352 повторных измерений по 49 моделям выявил, что стандартное отклонение между дневными медианами (8,43) примерно в три раза выше, чем внутри дня (2,80), что указывает на значительную временную вариативность. Авторы предлагают подходы для учёта этого: повторные прогоны, версионирование конфигураций бенчмарков, разделение сбоев возможностей и провайдера, а также анализ на уровне задач.
score 40r/artificial