Electroencephalography (EEG) is a non-invasive technique to measure and record brain electrical activity, widely used in various BCI and healthcare applications. Early EEG decoding methods rely on supervised learning, limited by specific tasks and datasets, hindering model performance and generalizability. With the success of large language models, there is a growing body of studies focusing on EEG foundation models. However, these studies still leave challenges: Firstly, most of existing EEG foundation models employ full EEG modeling strategy. It models the spatial and temporal dependencies between all EEG patches together, but ignores that the spatial and temporal dependencies are heterogeneous due to the unique structural characteristics of EEG signals. Secondly, existing EEG foundation models have limited generalizability on a wide range of downstream BCI tasks due to varying formats of EEG data, making it challenging to adapt to. To address these challenges, we propose a novel foundation model called CBraMod. Specifically, we devise a criss-cross transformer as the backbone to thoroughly leverage the structural characteristics of EEG signals, which can model spatial and temporal dependencies separately through two parallel attention mechanisms. And we utilize an asymmetric conditional positional encoding scheme which can encode positional information of EEG patches and be easily adapted to the EEG with diverse formats. CBraMod is pre-trained on a very large corpus of EEG through patch-based masked EEG reconstruction. We evaluate CBraMod on up to 10 downstream BCI tasks (12 public datasets). CBraMod achieves the state-of-the-art performance across the wide range of tasks, proving its strong capability and generalizability. The source code is publicly available at https://github.com/wjq-learning/CBraMod.
한 줄 요약
CBraMod은 EEG 신호의 구조적 특성을 고려한 크로스-크로스 트랜스포머와 ACPE를 통해 다운스트림 BCI 작업에서 최고 성능을 달성한 EEG 기초 모델이다.
핵심 기여도
- CBraMod은 기존 EEG 기초 모델이 고려하지 못한 EEG 신호의 이질적인 공간-시간 의존성을 모델링하는 **크로스-크로스 트랜스포머**를 제안함.
- **비대칭 조건부 위치 인코딩(ACPE)**을 도입하여 다양한 채널 구성과 시간 길이에 대한 모델의 적응성을 향상시킴.
- **TUEG 데이터셋**을 기반으로 대규모 EEG 데이터에서 **패치 기반 마스킹 EEG 재구성**을 통해 사전 학습함.
- 10개 이상의 다운스트림 BCI 작업에서 **최고 성능**을 달성함.
핵심 아이디어
기존 EEG 기초 모델은 이미지 패치와 유사한 방식으로 모든 EEG 패치 간 의존성을 모델링하는 **풀 EEG 모델링 전략**을 사용하지만, EEG 신호는 공간과 시간 의존성이 이질적이라는 점을 고려하지 못한다. CBraMod은 이러한 구조적 특성을 활용하기 위해 **크로스-크로스 트랜스포머**를 도입하여 공간과 시간 의존성을 병렬로 모델링한다. 또한, 기존의 고정된 위치 인코딩 방식 대신, **ACPE**를 통해 위치 정보를 동적으로 학습함으로써 다양한 EEG 형식에 대한 적응력을 높였다. 이는 특히 EEG 채널 구성과 참조 방식의 차이가 큰 다운스트림 작업에 유리하다.
기술적 접근법
- **크로스-크로스 트랜스포머**: 공간과 시간 의존성을 병렬로 모델링하는 두 개의 병렬 어텐션 메커니즘(공간 어텐션, 시간 어텐션)을 사용.
- **비대칭 조건부 위치 인코딩(ACPE)**: 공간 차원에서 긴 범위, 시간 차원에서 짧은 범위의 위치 정보를 인코딩하기 위해 비대칭 커널을 사용한 컨볼루션 네트워크로 동적으로 생성.
- **패치 기반 마스킹 EEG 재구성**: EEG 샘플을 고정된 시간 윈도우로 패치로 분할하고, 일부 패치를 마스킹한 후 재구성하는 방식으로 사전 학습.
- **시간-주파수 패치 인코딩**: 각 패치에서 시간 영역과 주파수 영역의 특성을 별도로 추출하고 결합.
- **사전 학습 데이터**: **TUEG 데이터셋**을 사용하여 사전 학습. 이는 현재까지 가장 큰 공개 EEG 코퍼스이다.
주요 결과
- CBraMod은 **12개 공개 데이터셋**에 걸쳐 최대 **10개의 다운스트림 BCI 작업**에서 **최고 성능**을 달성함.
- 기존 기초 모델 대비 **강력한 일반화 능력**을 보임.
- **TUEG 데이터셋** 기반의 사전 학습이 다양한 형식의 EEG 데이터에 잘 일반화됨.
- **비대칭 조건부 위치 인코딩(ACPE)**은 다양한 채널 구성과 참조 방식에 대한 모델의 적응성을 향상시킴.
의의 및 한계
CBraMod은 EEG 신호의 구조적 특성을 고려한 모델링 전략을 제안함으로써, 기존 기초 모델이 갖는 일반화 능력의 한계를 극복하였다. 특히, **크로스-크로스 트랜스포머**와 **ACPE**는 EEG 신호의 이질적인 공간-시간 의존성을 효과적으로 모델링하며, 다양한 BCI 작업에 적용 가능하다는 점에서 학술적·실용적 가치가 있다. 다만, **TUEG 데이터셋** 외의 다른 대규모 EEG 코퍼스에서의 성능 검증이 부족하며, **실시간 처리 성능**에 대한 평가도 추가 연구가 필요하다.
실용적 활용
CBraMod은 **의료용 BCI**, **정서 인식**, **운동 상상 분류**, **경련 탐지**, **수면 단계 분류** 등 다양한 BCI 작업에 적용 가능하다. 특히, **다양한 채널 구성과 참조 방식을 갖는 EEG 데이터**에 잘 적응하므로, 다양한 환경에서의 실용적 활용이 기대된다.