HelpSteer2: Open-source dataset for training top-performing reward models

Zhilin Wang, Yi Dong, Olivier Delalleau, Jiaqi Zeng, Gerald Shen, Daniel Egert, Jimmy Zhang, Makesh Narsimhan Sreedhar, Oleksii Kuchaiev

arXiv:2406.08673 · 2026-07-27 공개 · arXiv · PDF

open-source llm-alignment reward-models reward-bench steerlm cc-by-4-0 neomo-aligner preference-datasets

Abstract

High-quality preference datasets are essential for training reward models that can effectively guide large language models (LLMs) in generating high-quality responses aligned with human preferences. As LLMs become stronger and better aligned, permissively licensed preference datasets, such as Open Assistant, HH-RLHF, and HelpSteer need to be updated to remain effective for reward modeling. Methods that distil preference data from proprietary LLMs such as GPT-4 have restrictions on commercial usage imposed by model providers. To improve upon both generated responses and attribute labeling quality, we release HelpSteer2, a permissively licensed preference dataset (CC-BY-4.0). Using a powerful internal base model trained on HelpSteer2, we are able to achieve the SOTA score (92.0%) on Reward-Bench's primary dataset, outperforming currently listed open and proprietary models, as of June 12th, 2024. Notably, HelpSteer2 consists of only ten thousand response pairs, an order of magnitude fewer than existing preference datasets (e.g., HH-RLHF), which makes it highly efficient for training reward models. Our extensive experiments demonstrate that reward models trained with HelpSteer2 are effective in aligning LLMs. In particular, we propose SteerLM 2.0, a model alignment approach that can effectively make use of the rich multi-attribute score predicted by our reward models. HelpSteer2 is available at https://huggingface.co/datasets/nvidia/HelpSteer2 and code is available at https://github.com/NVIDIA/NeMo-Aligner

한국어 요약

한 줄 요약

HelpSteer2는 10,000개의 응답 쌍으로 구성된 오픈소스 퍼포먼스 데이터셋으로, SteerLM 2.0과 함께 사용 시 Reward-Bench에서 92.0%의 최고 성능을 달성한다.

핵심 기여도

핵심 아이디어

HelpSteer2는 기존 퍼포먼스 데이터셋의 한계를 극복하기 위해 설계된, 라이선스 제약이 적고 데이터 효율성이 높은 퍼포먼스 데이터셋이다. 기존 데이터셋은 수십만 개의 응답 쌍을 필요로 하지만, HelpSteer2는 10,000쌍의 응답만으로도 뛰어난 성능을 보인다. 이는 SteerLM 2.0과 같은 정밀한 속성 기반 훈련 방식을 통해 가능하다. SteerLM 2.0은 단순 이진 선호도가 아닌, 도움성, 정확성, 일관성, 복잡도, 길이 등 5가지 속성의 실수형 점수를 예측하는 회귀 기반 보상 모델을 사용한다. 이는 보상 모델이 "좋은 응답"의 정의를 명확히 이해하도록 도와주며, 예를 들어 응답 길이와 도움성 간의 혼동을 줄인다.

기술적 접근법

주요 결과

의의 및 한계

HelpSteer2는 라이선스 제약이 적고, 데이터 수량 대비 높은 효율성을 보이는 퍼포먼스 데이터셋으로, 오픈소스 AI 연구 및 상용 모델 개발에 기여할 수 있다. SteerLM 2.0은 다중 속성 점수를 기반으로 보상 모델을 훈련함으로써, 단순 이진 선호도 기반 모델보다 더 정확한 모델 정렬이 가능하다는 점에서 혁신적이다. 그러나 Prior Sets 카테고리에서 상대적으로 낮은 성능을 보이는 것은, 해당 데이터셋의 훈련 데이터와 겹치지 않기 때문으로 분석된다. 또한, Reasoning 분야에서는 UltraInteract와 같은 전용 데이터셋으로 훈련된 모델에 비해 성능이 뒤처진다.

실용적 활용

HelpSteer2는 LLM의 응답 품질을 향상시키기 위한 보상 모델 훈련에 활용할 수 있으며, 특히 라이선스 제약이 있는 데이터를 사용할 수 없는 상업적 환경에서 유용하다. SteerLM 2.0은 도움성, 정확성, 일관성 등 다양한 속성을 고려한 응답 생성을 가능하게 하므로, 복잡한 다중 요구사항을 처리하는 챗봇이나 고객 지원 시스템에 적용할 수 있다.