Назад к дайджесту
Reddit

Локальное тестирование моделей принятия решений на RTX 4090: сравнение скорости Laya, d1, Clef-Flash и Lev

Автор провел бенчмарк четырех открытых моделей для задач принятия решений (decision models) на видеокарте RTX 4090, оценивая их скорость инференса и точность при извлечении сущностей из текста. Исследование показывает, что модель Laya обеспечивает максимальную скорость обработки (3.9 мс на слово) благодаря использованию llama.cpp, в то время как Lev, работающий на PyTorch, оказался в 13 раз медленнее, но продемонстрировал более высокую точность распознавания.

score 40r/LocalLLaMA