한 줄 요약
SimLingo는 시각 정보만으로 자율주행과 언어-행동 정렬을 동시에 수행하는 첫 번째 모델로, CARLA 벤치마크에서 최고 성능을 달성했다.
핵심 기여도
- SimLingo는 InternVL-2 기반의 Vision-Language-Action 모델로, CARLA 2.0 리더보드에서 기존 최고 성능(CaRINA) 대비 4.6배, TF++ 대비 33% 개선된 성능을 보인다.
- 새로운 **Action Dreaming** 태스크를 제안하며, 언어-행동 정렬을 테스트하는 안전한 벤치마크를 제공한다.
- **Disentangled Path + Speed Waypoints**를 사용하여 충돌률을 0%로 낮추고, 주행 점수(DS)를 39.9% 향상시킨다.
- LiDAR 없이 카메라만 사용하는 경량 모델로, 기존 자율주행 모델과 차별화된다.
핵심 아이디어
SimLingo는 기존 자율주행 모델이 단일 작업(예: 주행 또는 시각-언어 이해)에만 집중하는 한계를 극복하기 위해 **3가지 작업**(주행, 시각-언어 이해, 언어-행동 정렬)을 통합한 모델을 제안한다. 특히, **Action Dreaming**이라는 새로운 데이터 수집 방법을 통해 언어 입력이 실제 행동에 어떻게 영향을 주는지를 안전하게 평가할 수 있다. 이는 기존 VQA 기반 접근법이 행동 공간과 분리되어 있어 모델의 답변과 행동이 불일치할 수 있는 문제를 해결하기 위한 핵심 아이디어이다. SimLingo는 InternVL-2 기반으로, **Path Waypoints**와 **Speed Waypoints**를 분리하여 더 정밀한 주행 제어를 가능하게 한다.
기술적 접근법
- **모델 아키텍처**: InternVL-2 기반으로, **Vision Encoder (InternViT-300M-448px)**와 **LLM (Qwen2-0.5B-Instruct)**을 결합.
- **입력 표현**: 카메라 이미지, GPS 타겟 포인트 또는 언어 명령(HLC), 차량 속도를 포함한 글로벌 프롬프트를 사용.
- **출력 표현**: **Path Waypoints (1m 간격)**와 **Speed Waypoints (0.25초 간격)**를 분리하여 PID 컨트롤러로 조향 및 가속 결정.
- **Token Interleaver**: 다양한 입력 모드(이미지, 탐색 정보, 언어)를 토큰화하여 LLM 입력 시퀀스로 결합.
- **Pixel Unshuffle 기법**: 448x448 타일로 이미지 분할 후, 토큰 수를 4배 축소하여 계산 효율성 향상.
- **Action Dreaming**: 미래 시나리오를 시뮬레이션하여 안전하지 않은 명령을 거부하는 능력을 훈련.
주요 결과
- **CARLA 2.0 리더보드**: SimLingo-BASE 모델이 CaRINA 대비 4.6배, TF++ 대비 33% 개선된 성능을 보인다.
- **Bench2Drive**: 기존 TCP-traj 모델 대비 DS 점수가 49.30 → 63.45로 14.15 증가.
- **VQA 성능**: DriveLM-hard 데이터셋에서 InternVL2 대비 SimLingo가 더 복잡한 주행 관련 질문에 정확한 답변을 제공.
- **충돌률**: Disentangled Waypoint 표현법을 사용한 경우, 정적 물체와의 충돌률을 0%로 줄임.
- **주행 점수**: Waypoint 표현 방식 변경으로 39.9% 향상.
의의 및 한계
SimLingo는 자율주행 분야에서 **LLM과 VLM의 통합**을 시도한 최초의 모델로, 주행 성능과 언어 이해력을 동시에 유지하는 데 성공했다. 특히, **Action Dreaming**은 언어-행동 정렬을 안전하게 평가할 수 있는 새로운 벤치마크를 제시하며, 기존 VQA 기반 접근법의 한계를 극복했다. 그러나, SimLingo는 **시뮬레이션 환경**(CARLA)에서만 평가되었으며, 실제 도로 환경에서의 성능은 아직 검증되지 않았다. 또한, **경량 모델**(1B 파라미터)임에도 불구하고, 고해상도 이미지 처리와 복잡한 LLM 연산으로 인해 실시간 처리 성능은 명시되지 않았다.
실용적 활용
SimLingo는 **저비용 카메라 기반 자율주행 시스템** 개발에 활용 가능하며, **자연어 명령 처리**와 **실시간 시각-언어 상호작용**이 필요한 차량-사람 협업 시스템에도 적용될 수 있다. 특히, **Action Dreaming**은 자율주행 모델의 안전성 검증 및 인간-로봇 상호작용 향상에 기여할 수 있다.