Назад к дайджесту
Reddit

Применение принципов многоскоростной DSP к LLM: иерархическая архитектура «Семантический вокодер»

Предложена двухуровневая архитектура для генерации текста, вдохновлённая аудио-вокодерами: медленный «планировщик» предсказывает семантические эмбеддинги предложений, а быстрый GPT-«вокодер» генерирует BPE-токены с локальным вниманием. Мост между уровнями использует апсемплинг и кросс-внимание для корректировки логитов. На TinyStories модель сходится значительно быстрее и глубже базовой GPT (loss 0.61 против 2.37), но выявлены проблемы чрезмерной зависимости от семантического сигнала.

score 40r/MachineLearning