Назад к дайджесту
Reddit

Нам нужен бенчмарк для оценки чувства юмора у языковых моделей

Пользователь предлагает ввести отдельный бенчмарк для оценки способности LLM генерировать юмор, так как текущие модели демонстрируют разрыв между теоретическим объяснением и практическим результатом. Тестирование показало, что даже SOTA-модели плохо понимают контекст и культурные нюансы, необходимые для создания качественных шуток.

score 40r/ChatGPT