Reddit
Модель Ling-3.0-flash MXFP4 запущена локально на DGX Spark
Вышла квантованная версия языковой модели Ling-3.0-flash в формате MXFP4, способная работать локально на одном GPU DGX Spark. Модель показывает ~80 токенов/сек при декодировании и 2500–3500 токенов/сек при префиллинге, поддерживая 3–4 одновременных пользователя для задач кодинга, агентов и оффлайн-обработки.
score 55r/LocalLLaMA