Reddit
Сокращение потребления токенов на 88% с помощью детерминированной маршрутизации изображений
Автор предлагает метод предварительной классификации изображений перед отправкой в VLM: если изображение содержит преимущественно текст без важной пространственной структуры, оно обрабатывается через OCR, а не передается как пиксели. Это позволяет сократить объем контекста на 88% по сравнению с прямым использованием визуального модуля и значительно экономит VRAM и пропускную способность.
score 40r/MachineLearning