한 줄 요약
유저 행동 데이터의 밀도 기반 토큰화 법칙(User Behavioral Densing Law)을 제안하고, ALGN이라는 적응형 토큰화 방법으로 대규모 유저 표현 학습 성능을 향상시킨다.
핵심 기여도
- **User Behavioral Densing Law**를 제안하여, 토큰화 용량과 데이터 규모 간의 정량적 관계를 정의.
- **ALGN(Adaptive Length Gated Network)**를 개발하여, 유저 행동 복잡도에 따라 토큰 길이를 적응적으로 조절.
- **Alipay PayBill 데이터셋**에서 토큰화가 원시 데이터 확장의 한계를 극복함을 실증.
- **AUC/KS/Acc** 지표에서 기존 기법 대비 최대 2.00%/5.21%/1.14% 개선.
핵심 아이디어
유저 행동 데이터는 반복적이고 정보 밀도가 낮아, 단순히 데이터 양이나 모델 크기를 늘리는 방식은 성능 향상에 한계가 있다. 이에 따라, **Behavioral Densing Law**는 데이터 규모와 최소한의 토큰화 용량 간의 관계를 정량적으로 정의하며, 토큰화를 통해 정보 밀도를 높이는 것이 핵심이다.
**ALGN**은 **RQ-VAE**(Residual Quantization VAE) 기반의 **변수 길이 토큰화**를 통해, 유저 행동 복잡도에 따라 토큰 길이를 조절한다. 이는 **잔차 노름**(residual norm)과 **코드 불확실도**(code uncertainty)를 기반으로 각 샘플에 대해 필요한 토큰 수를 결정하는 **로컬 마진 유틸리티**(local marginal utility) 원칙을 구현한 것이다.
기술적 접근법
- **Behavioral Densing Law**는 **데이터 규모**(token 수)와 **최소 토큰화 용량** 간의 **대수적 선형 관계**를 제시.
- **ALGN**은 **RQ-VAE** 기반의 **잔차 토큰화**를 사용하며, **변수 길이 토큰**(adaptive variable-length token)을 생성.
- 토큰 길이 결정은 **잔차 노름**(R_l)과 **코드 불확실도**(E_l)를 기반으로 **sigmoid + softplus 함수**를 통해 **계속 여부**(continuation probability)를 예측.
- 토큰화 학습에는 **재구성 손실**(ℒ_rec_act)과 **길이 분포 정규화**(length distribution regularizer)를 사용.
- **Geometric distribution**을 가정한 **prior Q**를 사용하여 길이 분포를 조절.
주요 결과
- **Alipay PayBill 데이터셋**에서 **ALGN**은 기존 토큰화 기법 대비 **86.91% → 63.47%**의 용량 사용 감소를 달성.
- **AUC/KS/Acc** 지표에서 각각 **2.00%/5.21%/1.14%** 개선.
- **코드 불확실도**(uncertainty signal) 제거 시, **AUC/KS/Acc**가 **1.32/3.10/0.75%** 하락.
- **잔차 신호**(residual signal) 제거 시 유사한 성능 저하 발생.
- **정규화**(regularization) 제거 시 용량 사용이 **73.42%**로 증가, **AUC/KS/Acc**는 **76.01%/42.21%/83.35%**로 하락.
의의 및 한계
- **Behavioral Densing Law**는 대규모 유저 표현 학습에서 **정보 밀도**(information density)가 핵심 제약 요소임을 밝혀내며, **토큰화 전략** 선택에 실질적 가이드라인을 제공.
- **ALGN**은 **유저 행동 복잡도에 따른 자원 할당 최적화**를 가능하게 하여, **성능-효율 균형**을 개선.
- 한계로는 **데이터 소스별 토큰화 파라미터**(예: 토큰화 메서드, 정규화 prior)의 **일관된 추정 방법**이 명시되지 않음. 또한, **모든 유저 행동이 동일한 토큰화 패턴을 따르지 않을 가능성**이 언급됨.
실용적 활용
- **추천 시스템**, **CTR/CVR 예측**, **유저 타겟팅** 등에서 **유저 행동 데이터의 효율적 표현**에 활용 가능.
- **대규모 유저 데이터**(10억 수준)를 처리하는 산업 시스템에서 **비용-성능 균형**을 개선하는 데 유용.
- **ALGN**은 **유저 행동 복잡도에 따라 자원을 적응적으로 할당**하므로, **실시간 유저 분석** 및 **개인화 서비스**에 적합.