DeepMind发布提高翻译质量的算法ReST

谷歌DeepMind发布论文,提出使LLM与人类偏好对齐更简单的算法ReST。不同于RLHF (基于人类反馈的强化学习) 使用人类反馈改进语言模型,ReST通过生成和使用离线数据训练。

上一篇:

下一篇:

发表回复

登录后才能评论