用RLHF 2%的算力让LLM停止有害输出,字节提出LLM遗忘学习

通过强化学习的方式对LLM进行微调,以改善其回复结果。遗忘学习的优势在于只需负样本(有害样本),计算成本低,且在知道导致LLM有害行为的训练样本时特别有效。实验表明遗忘学习在删除有害输出、移除侵权保护内容以及消除LLM幻觉等三个应用场景上表现出色。

上一篇:

下一篇:

发表回复

登录后才能评论