题目 ID: q-4810

在 PPO 中，如何防止模型在微调数据集以外的问题上泛化能力下降？如何防止模型收敛到单一类型的高奖励回答

频次 2

NLP与大模型

当前状态：未收藏、未完成

常见追问

暂无追问变体。

美团