Reddit
Нам нужен бенчмарк для оценки чувства юмора у языковых моделей
Пользователь предлагает ввести отдельный бенчмарк для оценки способности LLM генерировать юмор, так как текущие модели демонстрируют разрыв между теоретическим объяснением и практическим результатом. Тестирование показало, что даже SOTA-модели плохо понимают контекст и культурные нюансы, необходимые для создания качественных шуток.
score 40r/ChatGPT