Reddit
Кто-нибудь работает над уплотнением контекста?
Пользователь описывает проблему деградации качества ответов модели Qwen Flash Next в чат-приложении при использовании рекурсивных суммаризаций (L1→L2→L3) и хвоста из ~10 сырых сообщений. Несмотря на компактный контекст (5-8k токенов), после 120-140 сообщений модель начинает терять связность, что ставит вопрос о влиянии суммаризаций на когерентность и поиске решений по уплотнению контекста.
score 40r/LocalLLaMA