Назад к дайджесту
Reddit

Я протестировал 18 ИИ-моделей: какая пишет меньше всего «ИИ-мусором»

Автор запустил открытый бенчмарк theslopindex.com, оценивший 18 ИИ-моделей на предмет генерации «ИИ-мусора» по 5 критериям, включая человеческие предпочтения. Тестирование на 112 сценариях выявило, что модели, оптимизированные под бенчмарки, часто выдают более шаблонный текст. Проект демонстрирует важность человеческого фактора при оценке качества LLM-генерации.

score 40r/artificial