Назад к дайджесту
Reddit

POCKET-35B: агентная модель на CPU со скоростью 59 т/с

Появилась новая 35-миллиардная агентная языковая модель POCKET-35B, оптимизированная для запуска на CPU без видеокарты. Модель использует формат GGUF и библиотеку llama.cpp, позволяя работать на ПК с 16 ГБ ОЗУ или даже на смартфонах Android и iOS. Заявленная скорость генерации достигает 59 токенов в секунду при различных уровнях квантования.

score 40r/LocalLLaMA