GitHub
Визуальный тулкит для LLM-агентов: добавляем компьютерное зрение текстовым моделям
Инструментарий наделяет текстовые LLM-агенты возможностями компьютерного зрения: распознавание изображений, OCR, анализ скриншотов, визуальное позиционирование и конвертация в SVG. Поддерживает бесшовную интеграцию с Codex, Claude Code, OpenCode и Pi.
33014 forksPythonscore 82.2
visionopencodedeepseekllmclaude-codecomputer-useharness-engineeringkimiclicodex