Назад к дайджесту
Reddit

Длинные ответы в API: контекст обходится дороже, чем сам вывод модели

Автор анализирует использование токенов в длинных рабочих процессах через Responses API и обнаруживает, что стоимость генерации резко возрастает из-за накопления предыдущего контекста и результатов работы инструментов, а не из-за объема сгенерированного текста. В обсуждении рассматриваются стратегии оптимизации затрат, такие как обрезка старых данных или суммаризация контекста, чтобы избежать избыточных расходов на успешные, но ресурсоемкие запросы.

score 40r/OpenAI