Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset

Dan Su, Kezhi Kong, Ying Lin, Joseph Jennings, Brandon Norick, Markus Kliegl, M. Patwary, M. Shoeybi, Bryan Catanzaro

arXiv:2412.02595 · 2026-07-27 공개 · arXiv · PDF

long-horizon synthetic-data mmlu llama-3-1 common-crawl model-based-filtering pretraining-dataset classifier-ensembling

Abstract

Recent English Common Crawl datasets like FineWeb-Edu and DCLM achieved significant benchmark gains via aggressive model-based filtering, but at the cost of removing 90% of data. This limits their suitability for long token horizon training, such as 15T tokens for Llama 3.1. In this paper, we show how to achieve better trade-offs between accuracy and data quantity by a combination of classifier ensembling, synthetic data rephrasing, and reduced reliance on heuristic filters. When training 8B parameter models for 1T tokens, using a high-quality subset of our data improves MMLU by 5.6 over DCLM, demonstrating the efficacy of our methods for boosting accuracies over a relatively short token horizon. Furthermore, our full 6.3T token dataset matches DCLM on MMLU, but contains four times more unique real tokens than DCLM. This unlocks state-of-the-art training over a long token horizon: an 8B parameter model trained for 15T tokens, of which 7.2T came from our dataset, is better than the Llama 3.1 8B model: +5 on MMLU, +3.1 on ARC-Challenge, and +0.5 on average across ten diverse tasks. The dataset is available at https://data.commoncrawl.org/contrib/Nemotron/Nemotron-CC/index.html

한국어 요약

한 줄 요약

Nemotron-CC는 Common Crawl 데이터를 활용해 정확도와 데이터 양의 균형을 맞춘 6.3T 토큰의 훈련 데이터셋을 제시한다.

핵심 기여도

핵심 아이디어

기존 데이터셋(FineWeb-Edu, DCLM)은 모델 기반 필터를 사용해 정확도를 높였으나, 90%의 데이터를 제거하는 과도한 필터링으로 토큰 다양성과 양이 감소했다. Nemotron-CC는 앙상블 분류기와 합성 데이터 생성을 통해 정확도와 데이터 양의 균형을 맞추는 새로운 접근법을 제시한다. 합성 데이터는 고질량 텍스트를 재구성하여 노이즈를 줄이고, 토큰 다양성을 확보한다. 또한, 휴리스틱 필터 사용을 줄여 고질량 토큰 수를 증가시키는 동시에 정확도를 유지한다. 이는 특히 15T 토큰 이상의 장기 훈련에서 모델 성능 향상에 기여한다.

기술적 접근법

주요 결과

의의 및 한계

Nemotron-CC는 정확도와 데이터 양의 균형을 맞춘 최초의 데이터셋으로, 특히 장기 훈련(15T 이상)에서 뛰어난 성능을 보인다. 합성 데이터 생성과 분류기 앙상블은 토큰 다양성과 품질을 동시에 유지하는 데 기여하며, 휴리스틱 필터 제거는 데이터 양을 확보하는 데 효과적이다. 그러나 합성 데이터의 질이 모델 성능에 영향을 줄 수 있으며, 이는 추가 연구가 필요한 부분이다. 또한, 데이터셋의 공개는 커뮤니티의 재사용과 개선을 촉진한다.

실용적 활용

Nemotron-CC는 대규모 언어 모델의 장기 훈련(15T 이상)에 적합하며, 특히 MMLU, ARC-Challenge 등 추론 및 일반 지식 평가에서 높은 성능을 요구하는 연구에 활용 가능하다. 합성 데이터 생성 기법은 저품질 데이터를 개선하는 데도 활용될 수 있다.