题目 ID: q-5141

在RM训练阶段，我们通常收集的是成对比较数据，而不是让人类标注者直接给回复打一个绝对分数。你认为这样做的主要优势和潜在的劣势分别是什么？

频次 1

NLP与大模型

当前状态：未收藏、未完成

常见追问

暂无追问变体。

通用题库