Reddit
Веса Ling-3.0-flash от inclusionAI появились на Hugging Face — BF16 и официальная FP8-версия
Модель Ling-3.0-flash (127.5B параметров, 5.1B активных) стала доступна в двух форматах: BF16 (~255GB) и официальной FP8-квантовании (~128GB). Архитектура BailingMoeV3 использует 512 экспертов с 8 активными на токен, режим мышления переключается в шаблоне чата. Ключевой вопрос сообщества — поддержка в llama.cpp или только vllm/sglang.
score 40r/LocalLLaMA