Reddit
Релиз моделей без цензуры: LongCat-Flash-Lite, Jamba2-Mini и Qwen3.5 с поддержкой MTP в форматах GGUF и Safetensors
Разработчик представил версии моделей LongCat-Flash-Lite, Jamba2-Mini и Qwen3.5 без цензуры, используя технику Heretic и Multi-Token Prediction. Модели доступны в форматах GGUF и Safetensors, для корректной работы некоторых требуется специализированный форк llama.cpp. Отмечено значительное снижение количества отказов в ответах по сравнению с базовыми версиями.
score 55r/LocalLLaMA