Назад к дайджесту
Reddit

DeepSeek тренирует модель на 2 трлн параметров и планирует 8 трлн

DeepSeek обучает модель с 2 триллионами параметров и планирует создать модель с 8 триллионами. Текущие модели включают Flash с 552 млрд параметров и Pro с 1,6 трлн общих параметров при 49 млрд активных на токен. Также упоминается модель Mythos/Fable с оценкой в 10 трлн параметров.

score 40r/LocalLLaMA