Reddit
Что стало с BABA-is-AI: тестирование современных мультимодальных моделей на логических головоломках
Исследование показывает, что передовые мультимодальные LLM (GPT-4o, Gemini) терпят неудачу при задачах, требующих манипуляции и комбинирования правил игры. Работа, представленная на ICML 2024, подчеркивает ограничения текущих моделей в обобщении по сравнению с гипотетическими агентами будущего.
score 40r/MachineLearning