한 줄 요약
MobileNetV4는 다양한 모바일 하드웨어에서 Pareto 최적 성능을 보이는 모델로, UIB, Mobile MQA, NAS 개선, 디스틸레이션 기법 등을 통해 87% ImageNet-1K 정확도를 달성한다.
핵심 기여도
- **UIB (Universal Inverted Bottleneck)** 블록을 도입하여 IB, ConvNext, FFN, ExtraDW를 통합.
- **Mobile MQA** 블록으로 모바일 가속기에서 39%의 추론 속도 향상.
- **두 단계 NAS (Neural Architecture Search)** 레시피로 모델 탐색 효율성 향상.
- **MNv4-Hybrid-Large** 모델이 Pixel 8 EdgeTPU에서 3.8ms latency에 87% ImageNet-1K 정확도 달성.
핵심 아이디어
MobileNetV4는 다양한 모바일 하드웨어에서 균형 잡힌 성능을 제공하기 위해 **Universal Inverted Bottleneck (UIB)**이라는 새로운 블록을 도입했다. UIB는 기존의 Inverted Bottleneck (IB), ConvNext, FFN, 그리고 새로운 Extra Depthwise (ExtraDW) 블록을 통합한 유연한 구조로, 공간 및 채널 믹싱, 수용 필드 확장, 계산 효율성을 동시에 제공한다. 또한, 모바일 가속기 최적화를 위해 **Mobile MQA**라는 어텐션 블록을 제안하여 39%의 추론 속도 향상을 달성했다. 이 두 블록은 **두 단계 NAS 레시피**와 결합되어, 다양한 하드웨어에서 Pareto 최적 성능을 보이는 모델을 생성한다.
기술적 접근법
- **UIB 블록**: Inverted Bottleneck, ConvNext, FFN, ExtraDW를 통합한 유연한 구조.
- **Mobile MQA**: Multi-Head Attention 대비 39% 추론 속도 향상.
- **두 단계 NAS**: Coarse search와 fine-grained search로 분리하여 효율성 향상.
- **디스틸레이션 기법**: 다양한 데이터 증강과 in-class 데이터를 결합하여 정확도 향상.
- **MNv4-Hybrid-Large**: Pixel 8 EdgeTPU에서 3.8ms latency, 87% ImageNet-1K 정확도.
주요 결과
- **MNv4-Hybrid-Large** 모델은 Pixel 8 EdgeTPU에서 **3.8ms latency**에 **87% ImageNet-1K 정확도**를 달성.
- **MNv4-Conv-S**는 3.8M 파라미터, 0.2G MACs로 Pixel 6 CPU에서 2.4ms latency에 **73.8% ImageNet-1K 정확도**.
- **Mobile MQA** 블록은 Multi-Head Attention 대비 **39% 추론 속도 향상**.
- **UIB 블록**은 다양한 마이크로 아키텍처를 통합한 유연한 구조로, 계산 효율성 향상.
의의 및 한계
MobileNetV4는 다양한 모바일 하드웨어 (CPU, DSP, GPU, Apple Neural Engine, EdgeTPU 등)에서 **Pareto 최적 성능**을 보이는 최초의 모델로, 모바일 생태계에서의 범용성과 효율성을 동시에 달성한 점에서 학술적·실용적 가치가 크다. 특히, 디스틸레이션 기법을 통해 정확도를 87%까지 끌어올린 점은 모바일 모델의 성능 한계를 확장하는 데 기여한다. 그러나, 모든 하드웨어에서 완전히 Pareto 최적이라는 점은 명시되지 않았으며, 특정 애플리케이션에 최적화된 모델이 필요할 경우 한계가 있을 수 있다.
실용적 활용
MobileNetV4는 모바일 기기에서 실시간 이미지 분류, 객체 탐지, 비디오 처리 등에 활용 가능하다. 특히, EdgeTPU나 Apple Neural Engine과 같은 전용 가속기에서 빠른 추론 속도와 높은 정확도를 제공하므로, 스마트폰, IoT 기기, 모바일 로봇 등에서 실용적 활용이 기대된다.