Reddit
Автономный боксёрский бенчмарк для тестирования ИИ-моделей
Разработчик создал оригинальный бенчмарк, где LLM управляют боксёрами в симулированных боях — это тестирует скорость принятия решений, адаптивность и стратегию в реальном времени. Используются vision-модели (gemini-flash-live) для реакции на удары, отслеживаются метрики latency, TPS и корректность действий. Проект предлагает нестандартный подход к оценке ИИ-моделей под нагрузкой.
score 40r/MachineLearning