Reddit
Постулат: сжатие контекста полезно для квантованных моделей
Автор утверждает, что для квантованных моделей (около Q4) ошибка квантования накапливается с ростом контекста, поэтому оптимальным является контекст 128k с качественным сжатием вместо сырых 256k или 1M. Сжатие также помогает отфильтровывать шум — лишние файлы, логи терминалов и устаревшую информацию.
score 40r/LocalLLaMA