Reddit
E-Evaluation: Как сделать оценку текстов нейросетями стабильной
Использование LLM для оценки текстов часто приводит к нестабильным результатам из-за вероятностной природы моделей. Метод G-Eval от Microsoft решает эту проблему, предлагая использовать цепочку рассуждений (chain of thought) и взвешенное среднее на основе уверенности модели вместо простого выбора целого числа.
score 40r/AI_Agents