HelpSteer2官网链接地址:https://blogs.nvidia.com/blog/nemotron-4-synthetic-data-generation-llm-training/
网站默认显示语言:英语
HelpSteer2 介绍
HelpSteer2是一个由NVIDIA发布的开源数据集,旨在支持训练对齐模型以提高其帮助性、事实正确性和连贯性,同时具有可调节的复杂性和冗余度。该数据集与Scale AI合作创建,与Llama 3 70B基础模型一起使用时,在RewardBench上达到了88.8%的表现,是截至2024年6月12日最佳的奖励模型之一。
HelpSteer2用户群体
HelpSteer2数据集主要面向需要训练和优化对话系统、奖励模型和语言模型的开发者和研究人员。特别适合那些希望提高模型在特定任务上表现的专业人士,例如客户服务自动化、虚拟助手或任何需要自然语言理解和生成的场景。
用于训练SteerLM回归奖励模型,提高对话系统在特定任务上的表现。作为研究项目的一部分,分析和比较不同模型在处理多轮对话时的响应质量。在教育领域,帮助学生理解如何通过机器学习技术来改进语言模型的响应。
HelpSteer2的核心功能
- 包含21,362个样本,每个样本包括一个提示、一个响应以及五个人类标注的属性评分。属性评分包括帮助性、正确性、连贯性、复杂性和冗余度。支持多轮对话的样本,可以用于基于偏好对的DPO或Preference RM训练。响应由10种不同的内部大型语言模型生成,提供多样化但合理的响应。使用Scale AI进行标注,确保了数据集的质量和一致性。数据集遵循CC-BY-4.0许可,可以自由使用和分发。