Reddit
Qwen-3.8-Next-Flash: Ngram-инжектор знаний с горячей заменой для llama.cpp
Автор модифицировал llama.cpp, чтобы изменять Ngram PLE-таблицу модели Qwen в памяти, позволяя «горячо» подменять часть знаний без перезагрузки модели. Таблица обновляется на каждом промпте, что открывает возможность быстрой инъекции новых данных, хотя контроль вывода остаётся сложным из-за раннего внедрения эмбеддингов. Проект включает два репозитория: модификацию llama.cpp и компилятор патчей для таблицы, но требует много памяти и протестирован только с q8-квантизацией.
score 55r/LocalLLaMA