Назад к дайджесту
Reddit

Сокращение потребления токенов на 88% с помощью детерминированной маршрутизации изображений

Автор предлагает метод предварительной классификации изображений перед отправкой в VLM: если изображение содержит преимущественно текст без важной пространственной структуры, оно обрабатывается через OCR, а не передается как пиксели. Это позволяет сократить объем контекста на 88% по сравнению с прямым использованием визуального модуля и значительно экономит VRAM и пропускную способность.

score 40r/MachineLearning