한 줄 요약
AffectFlow-DINO는 조건부 정류 흐름(conditional rectified flow)을 활용해 얼굴 행동의 불확실성을 모델링하는 다중 태스크 감정 추정 시스템이다.
핵심 기여도
- 조건부 정류 흐름(conditional rectified-flow head)을 도입하여 단일 추정 대신 확률적 다중 예측을 수행.
- 감정-흥분(valence-arousal) 추정에서 CCC-V +0.058 개선.
- 후처리 임계값 교정(post-hoc threshold calibration)으로 극심히 불균형 클래스(Fear: 3.8% → 33.1%) 성능 회복.
- 최종 모델 P<sub>MTL</sub> = 1.177 달성, 공식 베이스라인 대비 +0.727 개선.
핵심 아이디어
AffectFlow-DINO는 얼굴 행동의 본질적 모호성을 반영하기 위해 단일 감정 추정이 아닌 조건부 생성 분포를 학습한다. 이는 Monte Carlo 샘플링을 통해 불확실성을 반영한 one-to-many 예측을 가능하게 한다. 기존 결정론적 모델이 단일 벡터로 모호성을 무시하는 반면, AffectFlow-DINO는 정류 흐름(rectified flow)을 통해 노이즈에서 조건부 분포 $ p(y|x) $로의 생성 맵을 학습한다. 이로 인해 각 이미지당 여러 개의 타당한 감정 벡터를 생성하고, 그 평균과 분산을 통해 예측의 신뢰도를 측정할 수 있다.
기술적 접근법
- **모델 구조**: DINOv3 ViT-S/16를 frozen backbone으로 사용.
- **학습 전략**: 조건부 정류 흐름(conditional rectified-flow head)을 통해 22차원 감정 벡터 공간에서 생성 분포를 학습.
- **다중 태스크**: 감정-흥분(VA), 8가지 표정, 12개의 Action Unit(AU)를 동시에 예측.
- **후처리**: AU 및 표정별 임계값 교정(post-hoc threshold calibration)을 적용.
- **하이퍼파라미터**: flow loss weight, inference efficiency, imbalance remedies, fine-tuning, calibration strategy 등 26가지 옵션에 대한 ablation study 수행.
주요 결과
- **감정-흥분 추정**: CCC-V +0.058 개선.
- **Fear 예측**: 임계값 교정 전 3.8% → 교정 후 33.1% (F1 기준).
- **Sadness 예측**: 17.1% → 28.2%.
- **최종 성능**: P<sub>MTL</sub> = 1.177 달성, 공식 베이스라인 대비 +0.727 개선.
- **표정 예측**: 최적 교정 시 P<sub>EXPR</sub> = 0.350 달성.
의의 및 한계
AffectFlow-DINO는 감정 추정에서 불확실성을 모델링함으로써 더 신뢰성 있는 예측을 가능하게 한다. 특히 극심한 클래스 불균형 상황에서도 후처리 교정을 통해 성능을 회복할 수 있다는 점에서 실용적 가치가 크다. 그러나 시간적 집약성(time aggregation)과 더 복잡한 디코더 구조가 필요하며, 모든 태스크에서 생성 분포가 결정론적 예측을 완전히 대체하지는 못한다. 또한, 테스트 데이터는 hidden set이므로 외부 일반화 능력은 추가 검증이 필요하다.
실용적 활용
AffectFlow-DINO는 감정 인식, 감정 기반 인터페이스, 정서적 행동 분석 등 다양한 인간-컴퓨터 상호작용(HCI) 분야에 적용 가능하다. 특히 감정 추정의 신뢰도를 정량적으로 평가해야 하는 의료, 교육, 보안 분야에서 유용할 수 있다.