한 줄 요약
CARDEA는 강력한 시각-언어 모델과 Chain-of-Box 추론을 결합해 치료 결정을 지지하는 체계적 CAG 해석 파이프라인을 제공한다.
핵심 기여도
- CARDEA는 단일 대규모 시각-언어 모델(Qwen3-VL-30B-A3B-Thinking)을 기반으로, CAG 영상 해석 파이프라인의 핵심 인퍼런스 코어로 사용됨.
- 세 단계 학습(visual feature alignment, self-distilled Chain-of-Box cold start, RLVR with CoB reward)을 통해 시각적 추론 능력과 검증 가능한 추론 추적을 결합.
- 병증 분류(accuracy 0.91)와 복잡도 평가(accuracy 0.90)에서 심장 전문의 수준에 근접.
- RLVR 단계가 zero-shot 보고서 생성 성능을 기존 모델 대비 0.686 (CI 0.664–0.707)로 향상.
핵심 아이디어
CARDEA는 기존 CAG AI 시스템의 주요 한계, 즉 **검증 불가능한 추론 과정**과 **개방형 평가 부재**를 해결하기 위해 설계되었다. 기존 모델은 단일 레이블 또는 좌표만 출력하는 **판별적 모델**이거나, 보고서 생성은 추론 과정과 분리되어 있어 **검증 불가능**하다. CARDEA는 **Chain-of-Box (CoB)** 추론을 도입해, 각 결론에 **경계 상자(bounding box)**를 연결함으로써 **시각적 근거**를 제공한다. 이는 의사가 모델의 추론 과정을 **실제 영상과 비교하여 검토**할 수 있게 한다.
또한, **강화 학습 with Verifiable Rewards (RLVR)**를 통해 CoB 추론을 강화하고, **zero-shot 보고서 생성** 능력을 유도한다. 기존의 지도 학습은 보고서 생성 능력을 훈련시키지 못했지만, RLVR은 정확한 답변에 기반한 보상으로 **내재적 합성 능력**을 강화하여 보고서 생성 성능을 향상시킨다.
기술적 접근법
- **모델 기반**: Qwen3-VL-30B-A3B-Thinking 기반의 대규모 시각-언어 모델.
- **학습 단계**:
- **추론 파이프라인**:
- **첫 번째 패스**: 각 영상에서 대표 키프레임 선택 및 뷰 분류.
- **두 번째 패스**: 키프레임 집합에 대해 CoB 기반 다중 이미지 추론 수행.
- **하이퍼파라미터**: 학습 스텝 400, 4× NVIDIA B200 GPU 사용, 텐서 병렬 처리.
1. **Visual Feature Alignment**: 일반 영상-언어 도메인에서 CAG 도메인으로 특징 정렬.
2. **Self-Distilled Chain-of-Box Cold Start**: 기존 모델의 경계 상자 추론을 기반으로 CoB 추론 훈련.
3. **Reinforcement Learning with Verifiable Rewards (RLVR)**: CoB 기반 보상을 통해 추론 추적 강화.
주요 결과
- **병증 분류 (Dominance Classification)**:
- In-distribution 데이터에서 전용 분류기보다 낮은 성능 (accuracy 0.91 vs. 0.95),
- 도메인 쉬프트 시 동일 수준 (accuracy 0.91 [CI 0.86–0.95]).
- **복잡도 평가 (Complexity Assessment)**:
- 심장 전문의와 유사한 정확도 (accuracy 0.90 [CI 0.82–0.97]).
- **Zero-shot 보고서 생성**:
- RLVR 단계에서 vessel-severity macro-F1 0.686 (CI 0.664–0.707) 달성,
- 기존 기반 모델 대비 0.513 → 0.686 향상,
- 항상 정상 판단 기준(0.312) 대비 2배 이상 향상.
의의 및 한계
CARDEA는 **단일 모델**로 CAG 영상 해석의 **전 단계**를 처리하며, **검증 가능한 추론 추적**을 제공하는 최초의 시스템이다. CoB 추론은 의사가 모델의 결론에 **시각적 근거**를 확인할 수 있게 하여 **신뢰도 향상**에 기여한다. RLVR를 통해 **개방형 보고서 생성** 능력을 유도한 점도 학술적·실용적 의의가 있다.
그러나 한계도 존재한다. 첫째, **임상 검증 미비**로 전문가와의 비교가 필요하다. 둘째, **학습 데이터가 혈관 및 협착에 집중**되어 다른 병변은 학습 부족. 셋째, **시간 동적 흐름 정보**는 키프레임 기반으로만 처리되어 잃어버림. 넷째, **도메인 쉬프트 시 CoB 사용률 감소** (65% → 92%)로 추론 신뢰도가 저하될 수 있음.
실용적 활용
CARDEA는 심장 전문 병원에서 CAG 영상 해석 자동화에 활용 가능하며, 의사의 판단을 보조하는 도구로 사용될 수 있다. 특히, 보조 진단 및 보고서 생성에서의 검증 가능성은 의료 AI의 임상 채택을 촉진할 수 있다. 또한, 교육 및 훈련 환경에서 모델의 추론 과정을 시각화해 학습자에게 해부학적 이해를