한 줄 요약
VLM을 강화학습으로 미세조정하여 7b 모델이 GPT4-V, Gemini를 초과하는 결정력 향상.
핵심 기여도
- VLM을 강화학습(RL)으로 미세조정하여 다단계 결정 작업에서 성능 향상.
- CoT(Chain-of-Thought) 추론을 도입하여 최종 텍스트 기반 행동으로의 효율적 탐색.
- 7b 모델이 GPT4-V, Gemini를 포함한 상용 모델을 초과하는 성능 달성.
- CoT 제거 시 성능 감소를 통해 CoT가 핵심 구성요소임을 입증.
핵심 아이디어
기존 VLM의 미세조정은 주로 시각 지시 데이터에 기반한 감독 학습으로 이루어지며, 이는 다단계 상호작용 환경에서 최적의 결정을 학습하는 데 한계가 있다. 본 연구는 VLM을 강화학습으로 직접 미세조정하는 새로운 알고리즘 프레임워크를 제안한다. 이 프레임워크는 작업 설명을 제공한 후 VLM이 CoT 추론을 생성하도록 유도하여, 최종 텍스트 기반 행동으로 이어지는 중간 추론 단계를 효율적으로 탐색하도록 한다. CoT는 단순한 텍스트 생성이 아닌, 최종 행동에 도달하기 위한 논리적 흐름을 명시적으로 표현하는 과정으로, 이는 강화학습의 탐색 효율성을 높이는 핵심 요소로 작용한다.
기술적 접근법
- **CoT 추론 생성**: 작업 설명을 입력으로 받아, VLM이 중간 추론 단계를 생성.
- **텍스트-실행 가능 행동 변환**: 생성된 텍스트를 환경과 상호작용할 수 있는 실행 가능한 행동으로 파싱.
- **강화학습 기반 미세조정**: 환경으로부터 받은 작업 보상을 기반으로 전체 VLM을 RL로 미세조정.
- **모델**: 7b 파라미터를 가진 VLM을 사용.
- **환경**: `gym_cards` (정밀 시각-언어 추론)와 `alfworld` (시각 의미 추론) 두 도메인에서 실험.
주요 결과
- `gym_cards`와 `alfworld` 도메인에서 7b 모델이 GPT4-V, Gemini를 포함한 상용 모델을 초과.
- CoT 추론 제거 시, 두 도메인에서 성능이 급격히 감소 (구체적 수치는 명시되지 않음).
- 환경 스텝 15,000회 수행에 약 30시간 소요 (2백만 스텝 수행에는 약 6개월 소요).
의의 및 한계
본 연구는 VLM을 강화학습으로 미세조정함으로써, 기존 감독 학습 기반 훈련 방식의 한계를 극복하고, 시각-언어 이해가 필요한 다단계 결정 작업에서 우수한 성능을 달성할 수 있음을 실증적으로 보여준다. 특히, CoT 추론을 통해 VLM의 추론 과정을 명시적으로 표현함으로써, 강화학습의 탐색 효율성을 높이는 새로운 패러다임을 제시한다. 그러나 7b 모델의 대규모 파라미터로 인해 환경 스텝 수행에 상당한 시간이 소요되며, 이는 대규모 RL 학습에 한계를 초래할 수 있다.
실용적 활용
본 연구는 로봇 제어, 게임 AI, 자율 시스템 등 시각-언어 이해가 필요한 다단계 결정 작업에 적용 가능하다. 특히, CoT 추론을 통한 추론 과정의 명시성은 인간-로봇 상호작용 시 설명 가능성과 신뢰도를 높이는 데 기여할 수 있다.