Reddit
Тест моделей Claude на умение использовать веб-поиск: Opus ошибся лишь в одном случае из 80
Автор протестировал способность моделей Claude (Opus, Sonnet 5, Fable, Haiku) самостоятельно решать, когда нужно использовать инструмент веб-поиска для ответов на вопросы, выходящие за пределы обучающей выборки. Результаты показали, что флагманская модель Opus приняла верное решение в 79 из 80 случаев, в то время как Sonnet 5 без системного промпта уверенно выдавал устаревшие данные, игнорируя поиск.
score 55r/ClaudeAI