Reddit
Расширение контекстного окна за пределы 262144 токенов
Пользователь использует Qwen3.8 27B с NVFP4 и vLLM, имея полное контекстное окно 262144 токена в FP8 и запас VRAM (4x16GB Tesla V100). Он хочет увеличить окно дальше и спрашивает о применении RoPE scaling / YaRN для этой модели, о том, как добиться лучшей производительности и точности, а также стоит ли это делать, не станет ли модель менее умной.
score 40r/LocalLLaMA