Назад к дайджесту
GitHub

Визуальный тулкит для LLM-агентов: добавляем компьютерное зрение текстовым моделям

Инструментарий наделяет текстовые LLM-агенты возможностями компьютерного зрения: распознавание изображений, OCR, анализ скриншотов, визуальное позиционирование и конвертация в SVG. Поддерживает бесшовную интеграцию с Codex, Claude Code, OpenCode и Pi.

33014 forksPythonscore 82.2
visionopencodedeepseekllmclaude-codecomputer-useharness-engineeringkimiclicodex