Reddit
Устал от тестов «на один проход»: есть ли методики для многошаговой отладки и анализа вывода ИИ?
Автор поста критикует доминирование одномоментных тестов в оценке кодинговых моделей и ищет альтернативы для проверки многошаговой отладки. Обсуждение фокусируется на синтетических задачах, где ИИ должен исправлять сломанный код и анализировать вывод, включая скриншоты. Это актуальная тема для улучшения метрик оценки LLM в реальных сценариях разработки.
score 40r/LocalLLaMA