Reddit
Добавление памяти в поиск вместо сэмплирования для задач максимизации награды
Авторы алгоритма FLEET предлагают метод, который использует внешние награды для корректировки логитов модели во время генерации, заменяя слепое повторное сэмплирование. Метод сохраняет истории наград в векторном хранилище и применяет модифицированный MCTS для ранжирования токенов, что позволяет достигать лучших результатов на GSM8K и LiveCodeBench при меньшем количестве итераций.
score 40r/MachineLearning