Google DeepMind released a paper proposing ReST, an algorithm that makes it simpler to align LLM with human preferences.Unlike RLHF (Reinforcement Learning Based on Human Feedback) which uses human feedback to improve language models, ReST is trained by generating and using offline data.
DeepMind Releases ReST, an Algorithm to Improve Translation Quality
Previous: 《开放加速规范AI服务器设计指南》发布
Next: Bengio:构建有意识的AI没有明显障碍