Назад к дайджесту
Reddit

Веса Ling-3.0-flash от inclusionAI появились на Hugging Face — BF16 и официальная FP8-версия

Модель Ling-3.0-flash (127.5B параметров, 5.1B активных) стала доступна в двух форматах: BF16 (~255GB) и официальной FP8-квантовании (~128GB). Архитектура BailingMoeV3 использует 512 экспертов с 8 активными на токен, режим мышления переключается в шаблоне чата. Ключевой вопрос сообщества — поддержка в llama.cpp или только vllm/sglang.

score 40r/LocalLLaMA