Назад к дайджесту
Reddit

Предобучена 700M-модель на 18B токенов с оптимизацией под Python и Wikitext

Разработчик выложил на Hugging Face новую языковую модель на 700 миллионов параметров, обученную на 18 миллиардах токенов. Модель оптимизирована для работы с Python и текстовыми данными, использует next-token prediction без чат-интерфейса. Автор утверждает, что она превосходит GPT-2, хотя и уступает современным флагманам вроде Qwen.

score 40r/LocalLLaMA