Reddit
POCKET-35B: агентная модель на CPU со скоростью 59 т/с
Появилась новая 35-миллиардная агентная языковая модель POCKET-35B, оптимизированная для запуска на CPU без видеокарты. Модель использует формат GGUF и библиотеку llama.cpp, позволяя работать на ПК с 16 ГБ ОЗУ или даже на смартфонах Android и iOS. Заявленная скорость генерации достигает 59 токенов в секунду при различных уровнях квантования.
score 40r/LocalLLaMA