한 줄 요약
Aya는 101개 언어(51개는 저자원 언어)에서 지시사항을 따르는 오픈소스 멀티링구 모델로, mT0와 BLOOMZ보다 대부분의 작업에서 성능이 우수하다.
핵심 기여도
- Aya 모델은 101개 언어를 지원하며, 이 중 51개 언어는 저자원 언어이다.
- xP3 데이터셋(46개 언어, 81M 데이터) 대비 2.5배 규모(203M 데이터)로 확장했으며, 영어 비중을 39%에서 21.5%로 줄였다.
- 99개 언어에 걸쳐 구분형, 생성형, 인간 평가, 안전성 평가 등 평가 범위를 확장했다.
- 인간 평가에서 7개 언어에서 mT0x 대비 75% 승률을 기록했다.
핵심 아이디어
Aya는 기존 멀티링구 모델이 대부분 고자원 언어에 집중된 반면, 저자원 언어를 포함한 다국어 지시사항 수행 능력을 확장하는 데 초점을 맞췄다. 이는 기존 IFT 데이터셋이 영어에 치우쳐 있다는 문제를 해결하기 위한 접근이다. Aya는 xP3 데이터셋을 기반으로 101개 언어로 확장한 203M 데이터를 사용했으며, 데이터 가중치 조정과 트리밍을 통해 언어 분포를 균형 있게 조정했다. 특히, 인간 주석을 기반으로 영어 인스턴스를 19.66%, 다국어 인스턴스를 18.25% 제거함으로써 언어 편향을 줄였다. 이는 기존 모델(mT0, BLOOMZ)이 다루지 못한 언어 범위와 평가 범위를 확장하는 데 기여한다.
기술적 접근법
- **모델 아키텍처**: mT5를 기반으로 13B 파라미터 규모의 Aya 모델을 구축.
- **데이터셋**: xP3(46개 언어, 81M) 대비 2.5배 규모인 203M 데이터를 사용.
- **데이터 구성**: 101개 언어 중 51개는 저자원 언어. 영어 비중 21.5%.
- **데이터 트리밍**: 인간 주석을 기반으로 영어 인스턴스 19.66%, 다국어 인스턴스 18.25% 제거.
- **모델 변형**: Aya-human-anno-heavy, Aya-template-heavy, Aya-translation-heavy 등 3가지 버전을 실험적으로 생성.
- **평가 방법**: 99개 언어에 걸쳐 구분형, 생성형, 인간 평가, 시뮬레이션 승률, 안전성 평가를 수행.
주요 결과
- **구분형 작업**: mT0x 대비 13.1% 성능 향상.
- **생성형 작업**: mT0x 대비 11.7% 성능 향상.
- **인간 평가**: 7개 언어에서 mT0x 대비 75% 승률.
- **모델 크기 영향**: 1.2B → 13B로 증가할 때, XWinograd, XNLI, XCOPA, XStoryCloze 등 구분형 작업에서 정확도 45.9% → 73.9%로 개선.
- **평가 언어 수**: 99개 언어(101개 중 2개 제외)로 확장.
의의 및 한계
Aya는 기존 멀티링구 모델이 다루지 못한 저자원 언어를 포함한 다국어 지시 수행 능력을 확장한 점에서 학술적·실용적 의의가 있다. 특히, 101개 언어를 지원하며, 이 중 51개는 저자원 언어로, 언어 불평등 문제를 완화할 수 있다. 또한, 99개 언어에 걸쳐 평가 범위를 확장함으로써 기존 연구의 한계를 극복했다. 그러나, 7,000개 언어 중 93%는 여전히 모델 학습에 포함되지 않아 언어 다각성 확보는 여전히 어려운 과제이다. 또한, 13B 파라미터 규모는 소비자용 하드웨어에서 실행이 어려워 압축 기술(퀀티제이션, 트리밍)이 필요하다.
실용적 활용
Aya는 저자원 언어 사용자에게 더 나은 품질의 언어 모델을 제공할 수 있으며, 글로벌 기업이나 교육 기관에서 다국어 지원 서비스를 개선하는 데 활용될 수 있다. 또한, 언어 평가 및 안전성 검증이 필요한 연구 분야에서 평가 기준 확장에 기여할 수 있다.