Назад к дайджесту
Reddit

Бенчмарк CivBench: как LLM играют в Civilization V

Исследователи представили контролируемую версию бенчмарка CivBench для оценки стратегического мышления больших языковых моделей в пошаговой стратегии Civilization V. Тестирование показало, что GLM-5.3 и Opus-5.5 демонстрируют высокие результаты, а Qwen-3.8-27B удивительно хорошо справляется с задачами долгосрочного планирования. Проект включает открытый инструмент Vox Deorum, позволяющий запускать игры против LLM или использовать их в качестве союзников.

score 40r/LocalLLaMA