Reddit
Идея: скорость декодирования на CPU зависит от активных параметров на токен, а не от общего размера модели. Цель — запуск 10B-параметровой модели со скоростью 100 ток/с на обычном ПК без GPU.
Автор предлагает архитектуру для запуска LLM на CPU без GPU, где скорость зависит от активных параметров на токен благодаря тринерным весам и MoE. Эксперименты на модели 8.3M показали рост скорости до 848 ток/с, а цель — 10B-параметровая модель на 100 ток/с. Исследование также сравнивает методы дистилляции и кросс-энтропии для сохранения качества при масштабировании.
score 40r/LocalLLaMA