한 줄 요약
Moirai는 다양한 주파수와 다변량 시계열을 처리하는 대규모 유니버설 트랜스포머로, 27B개의 LOTSA 데이터셋에서 사전 학습되어 제로샷 성능이 기존 모델을 앞선다.
핵심 기여도
- **Moirai**라는 새로운 마스킹된 인코더 기반 트랜스포머 아키텍처를 제안.
- **LOTSA**라는 9개 도메인에 걸쳐 27B개 샘플을 포함한 대규모 오픈 시계열 아카이브를 소개.
- **Any-variate Attention** 모듈을 통해 임의 수의 다변량을 처리 가능.
- **Mixture distribution**을 사용해 다양한 분포 특성을 반영한 확률적 예측 가능.
핵심 아이디어
기존 시계열 예측은 데이터셋당 하나의 모델을 사용하는 방식으로, 대규모 사전 학습 모델의 잠재력을 제한했다. Moirai는 **유니버설 예측**(universal forecasting)을 목표로, 다양한 주파수, 다변량, 분포 특성을 가진 데이터를 처리할 수 있는 **단일 대규모 모델**을 제안한다. 이는 **LOTSA** 데이터셋을 기반으로 사전 학습되며, **제로샷**(zero-shot) 환경에서도 기존 full-shot 모델과 유사하거나 더 높은 성능을 보인다. 핵심 아이디어는 **Cross-frequency learning**, **Any-variate Attention**, **Mixture distribution**을 통한 유연한 예측 구조다.
기술적 접근법
- **Moirai**는 **masked encoder-based Transformer** 아키텍처를 기반으로, **patch-based projection**을 통해 다양한 주파수를 처리.
- **Any-variate Attention**은 **RoPE**(Rotary Position Embedding)와 **binary attention bias**를 사용해 시간과 변수 축을 동시에 고려.
- **Mixture distribution**을 사용해 확률적 예측을 수행하며, **negative log-likelihood** 최적화를 통해 다양한 목표 지표에 대응.
- **LOTSA**는 9개 도메인, 27B개 샘플을 포함한 대규모 오픈 데이터셋.
- **Moirai Small, Base, Large** 모델은 각각 14M, 91M, 311M 파라미터를 사용.
주요 결과
- **Moirai**는 제로샷 환경에서 기존 full-shot 모델과 **경쟁적 또는 우수한 성능**을 보임.
- **Any-variate Attention** 제거 시 성능 저하 관찰 (normalized MAE 악화).
- **Mixture distribution** 대신 Student’s t-distribution 사용 시 예측 정확도 감소.
- **LOTSA** 데이터셋 기반 학습으로 **9개 도메인**에서 일관된 성능 개선.
의의 및 한계
Moirai는 **유니버설 예측**의 기반을 제공하며, **LOTSA**는 대규모 사전 학습을 위한 중요한 데이터셋으로 기여. 특히, **다변량, 다주파수, 확률적 예측**을 동시에 처리하는 유연한 구조가 학술적·실용적 가치를 높인다. 그러나, **LOTSA의 도메인 범위**나 **모델의 확장성**에 대한 한계는 추가 연구가 필요하다. 또한, **제로샷 성능**이 모든 도메인에서 일관되지 않을 가능성도 언급됨.
실용적 활용
Moirai는 **금융, 의료, IoT** 등 다양한 시계열 데이터를 처리하는 산업에서 **단일 모델로 다양한 예측 작업**을 수행할 수 있다. 특히, **데이터 수집이 어려운 도메인**에서 사전 학습된 유니버설 모델을 활용해 **빠른 적응**과 **높은 예측 정확도**를 달성할 수 있다.