Назад к дайджесту
Reddit

Настоящий потолок — токены в минуту, а не задержка: 2,2 хода в минуту на весь продукт. Когда очередь насыщается, бросать задачу или ставить в очередь?

Автор делится опытом, что узким местом агентного продукта оказался лимит токенов провайдера (8000 токенов/мин), а не задержка. Он разбирает, как ретраи на 429 усугубляют проблему, и показывает, что 65% промпта уходит на описание личности модели. Вопрос: при насыщении очереди лучше отбрасывать задачи или ставить их в очередь, и как сокращение токенов влияет на качество.

score 40r/AI_Agents