+
31
-

回答

CPT(继续预训练): 这是知识注入阶段。通过让模型学习特定领域的专业语料或企业内部私有数据,解决通用模型“不懂行”的问题,为其补充专属的行业知识库。

SFT(监督微调): 这是指令遵循阶段。利用高质量的“问题-标准答案”对进行训练,让模型学会理解人类指令,能够规范、准确地按要求完成具体任务。

DPO(直接偏好优化): 这是价值观对齐阶段。通过对比“好答案”与“差答案”,模型不再只是机械模仿,而是学会了人类的审美和偏好,确保输出内容更符合人类期望。

RL(强化学习): 这是能力升华阶段。利用奖励信号引导模型自我探索与优化,显著提升其在复杂推理、策略制定及高难度任务上的综合表现。

网友回复

我知道答案,我要回答