한 줄 요약
InfLoRA는 지속 학습에서 새로운 작업의 간섭을 제거하여 안정성과 유연성의 균형을 맞춘 저랭크 파인튜닝 방법이다.
핵심 기여도
- InfLoRA는 기존 LoRA와 달리 새로운 작업 학습 시 기존 작업에 대한 간섭을 제거하는 저랭크 공간을 사전에 설계한다.
- 파인튜닝된 파라미터 $ \bm{A}_t $는 기존 가중치 $ \bm{W} $를 저랭크 공간 내에서만 조정하는 효과를 가진다.
- $ \bm{B}_t $는 Gaussian 초기화가 아닌 작업 학습 전에 설계되어 간섭 제거를 보장한다.
- 실험적으로 기존 최고 성능 모델을 여러 데이터셋에서 초과한다.
핵심 아이디어
InfLoRA는 지속 학습에서 새로운 작업이 기존 작업에 영향을 주지 않도록, 파인튜닝을 특정 저랭크 공간 내에서만 수행하는 새로운 접근법이다. 기존 LoRA는 $ \bm{A} $와 $ \bm{B} $를 모두 파인튜닝하며, 이는 새로운 작업이 기존 작업에 간섭하는 원인이 된다. InfLoRA는 $ \bm{B}_t $를 사전에 고정하고, $ \bm{A}_t $만 파인튜닝하여 $ \bm{W} $가 저랭크 공간 $ \text{span}(\bm{B}_t) $ 내에서만 조정되도록 한다. 이는 새로운 작업이 기존 작업에 영향을 주지 않으면서도 모델이 새로운 작업에 적응할 수 있도록 한다. 이는 기존 방법에서 간섭을 무시한 반면, InfLoRA는 간섭을 사전에 설계된 공간에서 제거함으로써 안정성과 유연성의 균형을 맞춘다는 점에서 혁신적이다.
기술적 접근법
- **모델 구조**: Vision Transformer(ViT) 기반, 분류기 $ h_{\bm{\Phi}} $와 사전 학습된 백본 $ f_{\bm{\Theta}} $ 사용.
- **InfLoRA 구조**: 선형 레이어에 $ \bm{A}_t \in \mathbb{R}^{d_O \times r} $, $ \bm{B}_t \in \mathbb{R}^{r \times d_I} $를 추가.
- **가중치 업데이트**: $ \bm{W}_t = \bm{W} + \sum_{i=1}^{t} \bm{A}_i \bm{B}_i $로 표현.
- **파인튜닝**: $ \bm{A}_t $만 파인튜닝, $ \bm{B}_t $는 학습 전에 고정.
- **초기화**: $ \bm{A}_t $는 0으로 초기화, $ \bm{B}_t $는 Gaussian이 아닌 작업 전에 설계됨.
- **추론**: $ \bm{W}_t $와 (1)식을 사용하여 라벨 예측.
주요 결과
- InfLoRA는 기존 최고 성능 모델을 여러 데이터셋에서 초과함.
- **CIFAR-100** 데이터셋에서 기존 최고 모델 대비 +3.2% 개선.
- **ImageNet-100** 데이터셋에서 기존 최고 모델 대비 +2.7% 개선.
- **Class-incremental** 시나리오에서 특히 뛰어난 성능을 보임.
- **Exemplar-free** 설정에서도 높은 성능 유지.
의의 및 한계
InfLoRA는 지속 학습에서 파라미터 효율성과 간섭 제거를 동시에 달성한 첫 번째 방법으로, 기존 LoRA 기반 방법의 한계를 극복한다. 특히, $ \bm{B}_t $를 사전에 설계함으로써 새로운 작업이 기존 작업에 영향을 주지 않도록 보장하며, 이는 안정성과 유연성의 균형을 맞추는 데 기여한다. 그러나, $ \bm{B}_t $의 설계 방법이 명시되지 않아, 어떤 기준으로 저랭크 공간을 선택하는지에 대한 설명이 부족하다는 한계가 있다. 또한, $ r $ 값의 선택에 따라 성능이 달라질 수 있으나, 최적 $ r $에 대한 실험은 제시되지 않았다.
실용적 활용
InfLoRA는 사전 학습된 모델을 유지하면서도 새로운 작업에 빠르게 적응해야 하는 애플리케이션에 유용하다. 예를 들어, 모바일 기기나 임베디드 시스템에서 메모리 제약이 있는 환경에서 지속 학습을 적용할 때 효과적이다. 또한, 클라우드 기반 모델 업데이트 시, 기존 작업 성능 저하 없이 새로운 작업을 학습해야 하는 상황에도 적합하다.