한 줄 요약
Nemotron-CC는 Common Crawl 데이터를 활용해 정확도와 데이터 양의 균형을 맞춘 6.3T 토큰의 훈련 데이터셋을 제시한다.
핵심 기여도
- 분류기 앙상블, 합성 데이터 재구성, 휴리스틱 필터 감소를 결합한 새로운 데이터셋 생성 방법 제시.
- 1.1T 토큰의 고질량 하위 집합으로 DCLM 대비 MMLU 5.6 포인트 개선.
- 전체 6.3T 토큰 데이터셋은 DCLM과 동일한 MMLU 성능을 유지하면서 4배 더 많은 고유 토큰 포함.
- 15T 토큰 훈련 시 Llama 3.1 8B 모델 대비 MMLU +5, ARC-Challenge +3.1, 평균 +0.5 개선.
핵심 아이디어
기존 데이터셋(FineWeb-Edu, DCLM)은 모델 기반 필터를 사용해 정확도를 높였으나, 90%의 데이터를 제거하는 과도한 필터링으로 토큰 다양성과 양이 감소했다. Nemotron-CC는 앙상블 분류기와 합성 데이터 생성을 통해 정확도와 데이터 양의 균형을 맞추는 새로운 접근법을 제시한다. 합성 데이터는 고질량 텍스트를 재구성하여 노이즈를 줄이고, 토큰 다양성을 확보한다. 또한, 휴리스틱 필터 사용을 줄여 고질량 토큰 수를 증가시키는 동시에 정확도를 유지한다. 이는 특히 15T 토큰 이상의 장기 훈련에서 모델 성능 향상에 기여한다.
기술적 접근법
- **분류기 앙상블**: 여러 모델 기반 분류기를 결합하여 고질량 토큰을 선별.
- **합성 데이터 생성**: 고질량 텍스트를 재구성하여 1.9T 토큰의 합성 데이터 생성.
- **휴리스틱 필터 제거**: 기존 휴리스틱 필터 대신 학습된 분류기만 사용.
- **데이터셋 구성**: 4.4T 고유 원본 토큰 + 1.9T 합성 토큰으로 구성된 6.3T 토큰 데이터셋.
- **모델 훈련**: 8B 파라미터 모델을 15T 토큰으로 훈련, 7.2T 토큰은 Nemotron-CC에서 제공.
주요 결과
- **MMLU**: 1.1T 토큰 고질량 하위 집합에서 DCLM 대비 +5.6 포인트.
- **DCLM 대비 고유 토큰**: Nemotron-CC는 DCLM의 4배 많은 고유 토큰 포함.
- **15T 토큰 훈련 성능**: Llama 3.1 8B 대비 MMLU +5, ARC-Challenge +3.1, 평균 +0.5 개선.
- **모델 성능**: Nemotron-CC 기반 8B 모델은 MMLU 70.3, Llama 3.1 8B는 65.3 기록.
의의 및 한계
Nemotron-CC는 정확도와 데이터 양의 균형을 맞춘 최초의 데이터셋으로, 특히 장기 훈련(15T 이상)에서 뛰어난 성능을 보인다. 합성 데이터 생성과 분류기 앙상블은 토큰 다양성과 품질을 동시에 유지하는 데 기여하며, 휴리스틱 필터 제거는 데이터 양을 확보하는 데 효과적이다. 그러나 합성 데이터의 질이 모델 성능에 영향을 줄 수 있으며, 이는 추가 연구가 필요한 부분이다. 또한, 데이터셋의 공개는 커뮤니티의 재사용과 개선을 촉진한다.
실용적 활용
Nemotron-CC는 대규모 언어 모델의 장기 훈련(15T 이상)에 적합하며, 특히 MMLU, ARC-Challenge 등 추론 및 일반 지식 평가에서 높은 성능을 요구하는 연구에 활용 가능하다. 합성 데이터 생성 기법은 저품질 데이터를 개선하는 데도 활용될 수 있다.