Reddit
Обновление R9V: KVA-проекции на основе Deepseek V4.1 Flash и HySparse2/MiMo-V3 для Qwen3.8 Flash Next — ускорение префилла до 1,85 раза
Представлена реализация KVA-проекторов для модели Qwen3.8 Flash Next, позволяющая ускорить обработку промпта в 1,45–1,85 раза (до 3150 токенов/с) за счёт небольшого роста перплексии (+2,6–8% в зависимости от слоя). Метод использует Tikhonov-регуляризацию (ridge regression) и предсказывает входы для поздних слоёв, а не ключи/значения напрямую, что даёт большую точность, но требует около 1,5 ГБ VRAM. Автор отмечает, что модели, обученные с подобной техникой (например, Deepseek V4.1), могут быть более устойчивы к росту перплексии.
score 40r/LocalLLaMA