한 줄 요약
12개 VLM을 17개 설정에서 평가한 DriveBench를 통해 자율주행에서의 VLM 신뢰도 문제를 실증적으로 분석하고, Robust Agentic Utilization(RAU)을 제안한다.
핵심 기여도
- DriveBench 벤치마크를 제안: 19,200 이미지, 20,498 QA 쌍, 17개 설정(정상, 훼손, 텍스트만)에서 12개 VLM 평가.
- VLM이 훼손된 입력에서도 텍스트 기반으로 유사한 정확도(예: 텍스트 없는 입력에서도 정확도 유지)를 보이는 문제를 밝힘.
- 기존 평가 지표(예: ROUGE, BLEU, GPT 점수)가 자율주행 요구사항을 반영하지 못함을 지적.
- Robust Agentic Utilization(RAU)을 제안: 외부 도구와 결합하여 VLM의 훼손 인식 능력을 활용해 신뢰도 향상.
핵심 아이디어
자율주행에서 VLM이 시각 정보를 기반으로 신뢰할 수 있는 결정을 내리는지에 대한 가정은 검증되지 않았다. 본 연구는 VLM이 텍스트 기반 지식으로 응답을 생성하는 경향이 강하다는 점을 밝히며, 이는 훈련 데이터 불균형과 평가 지표의 한계로 인해 드러나지 않았다. 예를 들어, 텍스트만 입력된 경우에도 VLM이 정확도를 유지하는 현상은 인간 운전자와 대조된다. 이는 VLM이 시각 정보를 제대로 해석하지 못하면서도 외형상 신뢰도 높은 응답을 생성한다는 의미이다. 따라서, VLM의 훼손 인식 능력을 활용한 Robust Agentic Utilization(RAU)이 필요하다는 통찰을 제시한다.
기술적 접근법
- **DriveBench 벤치마크**: 12개 VLM(오픈소스 및 상용 모델 포함), 17개 설정(정상, 텍스트만, 15종 훼손), 5개 태스크(지각, 예측, 계획, 행동, 훼손 식별), 3개 평가 지표(정확도, ROUGE, GPT 점수)를 기반으로 평가.
- **평가 지표 개선**: 기존 ROUGE, BLEU, CIDEr는 자율주행의 복잡한 요구사항을 반영하지 못함. GPT-3.5-turbo를 활용한 GPT 점수와 세부 평가 기준(정답 정확도, 일관성, 설명-결정 일치도)을 도입.
- **Robust Agentic Utilization(RAU)**: VLM의 훼손 인식 능력을 외부 도구와 결합하여 신뢰도를 향상시키는 프레임워크 제안.
주요 결과
- **VLM의 훼손 내성 문제**: 텍스트만 입력 시에도 정확도가 유지되며, 이는 실제 시각 정보를 기반하지 않음.
- **데이터 불균형의 영향**: 단일 프레임 질문과 편향된 데이터로 인해 "Going Ahead" 같은 단순 응답이 90% 이상 정확도를 보임.
- **GPT 점수 한계**: GPT-3.5-turbo 기반 점수도 자율주행의 안전성과 맥락 이해를 측정하지 못함.
- **RAU 효과**: VLM의 훼손 인식 능력을 활용한 RAU는 다양한 다운스트림 태스크에서 신뢰도를 향상시킴.
의의 및 한계
본 연구는 VLM이 자율주행에서 신뢰할 수 있는 결정을 내리는지에 대한 핵심 질문을 제기하고, DriveBench를 통해 실증적으로 검증하였다. 기존 평가 지표와 데이터셋의 한계를 지적하며, RAU를 통해 VLM의 신뢰도를 향상시키는 방향을 제시하였다. 그러나 RAU의 구체적인 구현 방식과 외부 도구와의 통합 방식은 추가 연구가 필요하다. 또한, DriveBench는 특정 VLM과 데이터셋에 기반하기 때문에 일반화 가능성에 대한 논의가 필요하다.
실용적 활용
DriveBench와 RAU는 자율주행 시스템 설계, VLM 기반 인터페이스 개발, 안전성 평가 프로세스에서 활용 가능하다. 특히, VLM의 시각 정보 해석 능력을 평가하고, 안전-critical 상황에서 신뢰도를 높이는 데 기여할 수 있다.