image-classification vision-transformers convnext mobilenetv2 convolutional-neural-networks wavelet-convolutions large-receptive-fields wtconv
Abstract
In recent years, there have been attempts to increase the kernel size of Convolutional Neural Nets (CNNs) to mimic the global receptive field of Vision Transformers' (ViTs) self-attention blocks. That approach, however, quickly hit an upper bound and saturated way before achieving a global receptive field. In this work, we demonstrate that by leveraging the Wavelet Transform (WT), it is, in fact, possible to obtain very large receptive fields without suffering from over-parameterization, e.g., for a $k \times k$ receptive field, the number of trainable parameters in the proposed method grows only logarithmically with $k$. The proposed layer, named WTConv, can be used as a drop-in replacement in existing architectures, results in an effective multi-frequency response, and scales gracefully with the size of the receptive field. We demonstrate the effectiveness of the WTConv layer within ConvNeXt and MobileNetV2 architectures for image classification, as well as backbones for downstream tasks, and show it yields additional properties such as robustness to image corruption and an increased response to shapes over textures. Our code is available at https://github.com/BGU-CS-VIL/WTConv.
한국어 요약
한 줄 요약
Wavelet Transform을 활용한 WTConv 레이어로, 과매개변수화 없이 대규모 수용 필드를 구현한다.
핵심 기여도
- Wavelet Transform (WT)을 기반으로 한 WTConv 레이어를 제안, 수용 필드 크기 $k$에 대해 학습 가능한 파라미터 수가 로그 스케일로 증가.
- 기존 ConvNeXt와 MobileNetV2에 적용했으며, 이미지 분류 및 다운스트림 작업에서 뛰어난 성능을 보임.
- 이미지 손상에 대한 내성과 형태에 대한 반응 증가라는 추가적인 특성을 제공.
핵심 아이디어
기존 CNN에서 수용 필드를 확장하려면 커널 크기를 늘려야 하지만, 이는 과매개변수화와 계산 복잡도 증가를 초래한다. 본 연구는 Wavelet Transform을 활용해 대규모 수용 필드를 구현하면서도 파라미터 수를 로그 스케일로 제어할 수 있음을 보인다. WTConv는 빈도 영역에서 다중 주파수 반응을 유도하며, 기존 CNN 아키텍처에 바로 적용 가능한 drop-in 레이어로 설계되었다.
기술적 접근법
- **WTConv 레이어**: Wavelet Transform 기반의 컨볼루션 레이어로, 수용 필드 크기 $k$에 대해 파라미터 수가 $\log(k)$ 비례하여 증가.
- **적용 아키텍처**: ConvNeXt와 MobileNetV2에 적용.
- **데이터셋**: 이미지 분류 및 다운스트림 작업에 사용, 구체적인 데이터셋 명시되지 않음.
주요 결과
- 이미지 분류 및 다운스트림 작업에서 WTConv 적용 모델이 기존 모델 대비 **내구성과 형태 반응 향상**을 보임.
- **이미지 손상 내성** 향상 및 **텍스처 대비 형태 반응 증가**라는 추가적인 특성 보임.
- 수용 필드 확장 시 **과매개변수화 없이 성능 향상**을 달성.
의의 및 한계
WTConv는 CNN에서 대규모 수용 필드를 구현하는 새로운 방식을 제시하며, 파라미터 효율성과 성능 향상을 동시에 달성한다. 특히, Vision Transformer와 유사한 글로벌 수용 필드를 구현할 수 있는 가능성을 열어준다. 그러나, 구체적인 성능 수치나 비교 실험은 명시되지 않았으며, 다양한 데이터셋에서의 일반화 가능성은 추가 연구가 필요하다.
실용적 활용
WTConv는 이미지 분류, 객체 감지, 세그멘테이션 등 다양한 시각 작업에 적용 가능하며, 특히 계산 자원이 제한된 모바일 및 임베디드 환경에서 파라미터 효율성과 성능을 동시에 요구하는 경우에 유용할 수 있다.