한 줄 요약
LESS는 대규모 언어 모델의 특정 능력 향상을 위해 5%의 데이터만으로도 전체 데이터셋보다 우수한 성능을 보이는 데이터 선택 알고리즘이다.
핵심 기여도
- **LESS 알고리즘** 제안: Adam 최적화기와 가변 길이 데이터를 고려한 영향력 추정을 통해 데이터 선택.
- **5% 데이터 선택**으로도 MMLU, TydiQA, BBH 등 다운스트림 태스크에서 전체 데이터셋 훈련보다 더 높은 성능.
- **Transferable Gradient Datastore** 구축: LoRA와 랜덤 프로젝션을 활용해 저차원 그라디언트 특징 저장.
- **작은 모델로 큰 모델 훈련 데이터 선택 가능** (Table 2 참조).
핵심 아이디어
기존의 데이터 선택 방법은 표면적 특징(예: 언어, 주제)에 의존하는 반면, LESS는 **Low-rank Gradient Similarity Search**를 통해 특정 능력을 나타내는 **few-shot 예시와 유사한 그라디언트 패턴**을 가진 데이터를 선택한다.
이 방법은 **Adam 최적화기**와 **가변 길이 instruction 데이터**를 고려한 **optimizer-aware influence estimation**을 기반으로 하며, 기존의 SGD 기반 영향력 추정법을 확장한 것이다.
또한, **LoRA**와 **랜덤 프로젝션**을 활용해 그라디언트 정보를 저차원으로 압축하여 저장함으로써 **계산 효율성**과 **재사용성**을 동시에 달성한다.
기술적 접근법
- **Gradient Datastore**: LoRA와 랜덤 프로젝션을 사용해 저차원 그라디언트 특징을 저장.
- **Low-rank Gradient Similarity Search**: few-shot 예시와 유사한 그라디언트 패턴을 가진 데이터를 선택.
- **Adam 최적화기 호환**: 기존의 SGD 기반 영향력 추정법을 Adam 최적화기와 가변 길이 데이터에 맞게 수정.
- **하이퍼파라미터**: 데이터셋의 5%만 선택해 훈련.
- **데이터셋**: MMLU, TydiQA, BBH 사용.
주요 결과
- **MMLU, TydiQA, BBH** 데이터셋에서 **5% 데이터만 선택**해 훈련했을 때, 전체 데이터셋 훈련보다 더 높은 성능.
- **작은 모델**로 선택한 데이터가 **큰 모델**과 **다른 모델 가족**에도 효과적 (Table 2).
- **표면적 특징**이 아닌 **추론 능력**을 나타내는 데이터가 선택됨 (§6.2).
의의 및 한계
LESS는 대규모 언어 모델의 특정 능력 향상을 위한 **데이터 선택의 효율성과 해석성**을 동시에 달성한 점에서 학술적·실용적 가치가 있다. 특히, **저차원 그라디언트 저장소**를 재사용함으로써 **계산 비용을 줄이고 반복적인 데이터 선택 과정을 가능**하게 한다.
하지만, **계산 비용이 높아** 실용적 적용 시 한계가 있을 수 있다. 또한, **더 많은 데이터가 오히려 성능 저하를 유발**할 수 있다는 관찰은 LLM의 학습 동역학에 대한 새로운 통찰을 제시하지만, 이는 추가 연구가 필요한 부분이다.
실용적 활용
LESS는 **대규모 언어 모델의 특정 능력 향상**을 목표로 하는 산업 현장(예: 추론, 다국어 지원)에서 유용하게 활용될 수 있다. 또한, **데이터가 제한된 상황**에서 **작은 모델로 큰 모델 훈련 데이터를 선택**하는 데 적합하며, **비용 효율적인 모델 훈련 전략**으로도 활용 가능하다.