한 줄 요약
Mimir v1은 허가된 데이터만을 사용해 10억 파라미터 HRM 모델로, 영어 및 덴마크어 벤치마크에서 뛰어난 성능을 보인다.
핵심 기여도
- Mimir v1은 161개의 허가된 데이터셋(총 약 705억 토큰)을 사용해 10억 파라미터 HRM-Text 아키텍처로 학습됨.
- 덴마크어 벤치마크에서 기존 모델을 36.7% 초과 (64.1 vs. 46.9).
- 영어 BoolQ, Winogrande, DROP에서 HRM-Text, Qwen 3.5, Gemma 3 등 1B 파라미터 모델을 상회.
- 합성 "transplant dataset"을 통해 허가되지 않은 데이터를 대체하며 데이터 권리 보호를 유지.
핵심 아이디어
Mimir v1은 허가된 데이터만을 사용하는 제약하에서도 뛰어난 성능을 달성하기 위해 HRM-Text 아키텍처를 채택하고, 합성 데이터 생성을 통해 데이터 부족 문제를 해결했다. HRM-Text는 계층적 추론 구조(H-cycle과 L-cycle)를 통해 복잡한 추론을 가능하게 하며, RoPE와 pre-norm layer normalization을 통해 학습 안정성을 높인다. 이는 특히 덴마크어와 같이 저자원 언어에 적합한 접근법으로, 허가된 데이터만으로도 10억 파라미터 모델이 뛰어난 성능을 낼 수 있음을 입증한다.
기술적 접근법
- **모델 아키텍처**: HRM-Text, 1,536 hidden size, 12 attention heads, 4x feed-forward expansion.
- **계층적 추론**: 2개의 H-cycle, 3개의 L-cycle, truncated backpropagation 5 steps, warmup ratio 0.2.
- **Positional Encoding**: RoPE (θ = 10,000), pre-norm layer normalization (ϵ = 10⁻⁶).
- **데이터**: 161개 허가된 데이터셋, 약 70.5억 토큰/에포크.
- **합성 데이터**: 허가되지 않은 데이터 대체용 "transplant dataset" 생성.
주요 결과
- **덴마크어**: DaLA, GEC, WikiQA, N.News에서 경쟁 모델을 상회, 평균 성능 1위.
- **영어**: BoolQ, Winogrande, DROP에서 HRM-Text, Qwen 3.5, Gemma 3 등 1B 파라미터 모델을 초과.
- **수학 및 코드**: GSM8K, HumanEval에서 1B 파라미터 모델 중 최상위 성능, HRM-Text 대비 36.7% 개선.
- **전체 평균**: 영어에서 Qwen 3.5 4B 대비 0.3점, 수학/코드에서 SmolLM3 3B 대비 3.8% 뒤처짐.
의의 및 한계
Mimir v1은 허가된 데이터만을 사용해도 10억 파라미터 모델이 뛰어난 성능을 낼 수 있음을 입증하며, 저자원 언어 모델링의 새로운 가능성을 제시한다. 특히, 합성 데이터 생성 기법은 데이터 권리 보호와 모델 성능 간의 균형을 맞추는 데 기여한다. 그러나 허가된 데이터의 양이 제한적이라 더 큰 모델로 확장하는 데 한계가 있을 수 있다. 또한, 일부 벤치마크에서 2–5B 파라미터 모델에 비해 여전히 성능 격차가 존재한다.
실용적 활용
Mimir v1은 덴마크어 및 영어를 사용하는 저자원 언어 커뮤니티, 데이터 권리 준수를 요구하는 기업, 오픈소스 모델 개발자에게 유용하다. 특히, 훈련 및 추론 비용이 낮아 연구 및 실무 환경에서 즉각적으로 활용 가능하다.