Reddit
124 млрд параметров, но активны лишь ~5 млрд — именно такой формат мне нужен. Не стали ли низкоактивные MoE новым идеалом для локального запуска?
В обсуждении рассматривается тренд на Mixture of Experts (MoE) модели с малым количеством активных параметров, что критично для локального инференса на ограниченном оборудовании. Автор указывает, что для Mac и CPU-серверов важнее скорость работы с активными весами, чем общий размер модели. Поднимается вопрос о том, когда малое число активных параметров начинает уступать плотным моделям в качестве генерации.
score 40r/singularity