Reddit
Обзор литературы: MobileWorld — бенчмарк автономных мобильных агентов в интерактивных и MCP-расширенных средах
Автор делится впечатлениями о статье MobileWorld, представляющей новый бенчмарк для оценки LLM-агентов, выполняющих GUI-задачи на смартфонах. Бенчмарк включает 201 задачу и около 20 приложений, вводя два новых направления: задачи с взаимодействием с пользователем (где роль человека играет GPT-4) и задачи с использованием MCP-инструментов (например, GitHub, arXiv). Лучшая комбинация моделей (Gemini-3-Pro + UI-Inst-7B) достигает лишь ~52% точности, при этом модели показывают особенно слабые результаты на новых осях.
score 40r/LocalLLaMA