Reddit
OpenAI представляет MentalHealthBench — экспертный бенчмарк для безопасных ответов в разговорах о психическом здоровье
OpenAI выпустила новый бенчмарк MentalHealthBench, разработанный с участием экспертов для оценки безопасности и качества ответов языковых моделей в диалогах, касающихся психического здоровья. Инструмент предназначен для тестирования LLM в чувствительной области и помогает выявлять потенциально вредные или неуместные реакции.
score 55r/OpenAI