Назад к дайджесту
Reddit

Автономный боксёрский бенчмарк для тестирования ИИ-моделей

Разработчик создал оригинальный бенчмарк, где LLM управляют боксёрами в симулированных боях — это тестирует скорость принятия решений, адаптивность и стратегию в реальном времени. Используются vision-модели (gemini-flash-live) для реакции на удары, отслеживаются метрики latency, TPS и корректность действий. Проект предлагает нестандартный подход к оценке ИИ-моделей под нагрузкой.

score 40r/MachineLearning