Reddit
Предобучена 700M-модель на 18B токенов с оптимизацией под Python и Wikitext
Разработчик выложил на Hugging Face новую языковую модель на 700 миллионов параметров, обученную на 18 миллиардах токенов. Модель оптимизирована для работы с Python и текстовыми данными, использует next-token prediction без чат-интерфейса. Автор утверждает, что она превосходит GPT-2, хотя и уступает современным флагманам вроде Qwen.
score 40r/LocalLLaMA