Назад к дайджесту
Reddit

Выпущена модель для тестирования агентов: 97.5% полезности там, где другие отказываются

Команда выпустила дообученную версию модели GLM-5.2, оптимизированную для агрессивного тестирования агентов и ред-тиминга без встроенных отказов. Модель демонстрирует 97.5% полезности по метрике AgentDojo и сохраняет высокие результаты в кодинге (SWE-bench, Terminal-Bench). API совместима с OpenAI и Anthropic, что позволяет использовать её как инструмент для проверки безопасности других систем.

score 55r/AI_Agents