Назад к дайджесту
Reddit

Постулат: сжатие контекста полезно для квантованных моделей

Автор утверждает, что для квантованных моделей (около Q4) ошибка квантования накапливается с ростом контекста, поэтому оптимальным является контекст 128k с качественным сжатием вместо сырых 256k или 1M. Сжатие также помогает отфильтровывать шум — лишние файлы, логи терминалов и устаревшую информацию.

score 40r/LocalLLaMA