Reddit
Измерение дрейфа производительности LLM: наблюдения и методология на основе 31 352 повторных измерений бенчмарков
Автор критикует подход к бенчмаркам LLM как к статичным снимкам, отмечая, что API-модели могут менять поведение со временем из-за изменений в инфраструктуре, конфигурациях и версиях. Вместо этого предлагается рассматривать бенчмаркинг как продольное измерение, отслеживая отклонения от собственного базового уровня модели и учитывая вариативность повторных вызовов. Анализ 31 352 повторных наблюдений по 49 моделям показал, что стандартное отклонение внутри дня составляет 2,80 пункта, а между днями — 8,43 пункта, что указывает на значительную временную вариативность, которую нельзя игнорировать.
score 40r/MachineLearning