한 줄 요약
Co-RL은 다중 에이전트 강화학습을 통해 라벨 없이도 언어 및 비주얼-언어 모델의 추론 성능을 향상시키는 프레임워크이다.
핵심 기여도
- Co-RL은 라벨 없이 다중 에이전트가 서로의 예측을 기반으로 강화학습을 수행함으로써 비감독 추론을 가능하게 함.
- 다양한 모델 가족, 크기, 재구성된 훈련 샘플을 통해 코호트 다양성을 증가시켜 자기 강화 학습의 한계를 극복함.
- 7개 텍스트 기반 벤치마크에서 평균 3.0–8.6%, 4개 멀티모달 벤치마크에서 2.3–7.2%의 성능 향상 기록.
- CoMAS 평가에서 기존 다중 에이전트 RL 방법 대비 4.0% 개선, 에이전트 수를 절반으로 줄임.
핵심 아이디어
Co-RL은 단일 모델 내에서 발생하는 자기 강화 학습의 한계를 극복하기 위해, 서로 다른 모델 간의 협력적 학습을 도입한 프레임워크이다. 기존 자기 평가 방식은 모델의 고유한 편향을 강화하고 응답 다양성을 감소시키는 경향이 있었으나, Co-RL은 서로 다른 모델이 독립적으로 훈련되어 서로의 예측을 기반으로 보상을 생성함으로써 **decorrelated supervision**을 제공한다. 이는 모델 간의 오류가 완전히 상관되지 않기 때문에, 하나의 모델이 다른 모델의 예측을 기준으로 보정할 수 있게 된다.
핵심적인 통찰은 **코호트 다양성**이 성능 향상에 결정적이라는 점이다. Co-RL은 모델 가족, 크기, 훈련 샘플의 재구성을 통해 다양한 인덕티브 바이어스를 도입함으로써 상관된 오류를 감소시키고, 보다 강력한 보정 신호를 생성한다. 이는 **majority voting**을 통해 각 에이전트가 여러 샘플을 생성하고, 다른 에이전트의 의사결정을 기준으로 보상을 계산하는 방식으로 구현된다.
기술적 접근법
- **Co-RL**은 다중 에이전트 강화학습 프레임워크로, 서로 다른 모델이 파라미터를 공유하지 않고 독립적으로 훈련됨.
- 각 에이전트는 주어진 프롬프트에 대해 여러 샘플을 생성하고, **majority voting**을 통해 가상 정답(pseudo-answer)을 생성.
- 다른 에이전트의 샘플이 이 pseudo-answer에 대해 보상을 받으며, **GRPO** 또는 **REINFORCE++** 알고리즘을 사용해 정책 최적화.
- **decorrelated supervision**을 통해 자기 평가 방식의 피드백 루프를 차단.
- 코호트 다양성 확보를 위해 **다양한 모델 가족**, **크기**, **재구성된 프롬프트**를 사용.
- **CoMAS** 평가에서 기존 다중 에이전트 RL 방법 대비 4.0% 개선, 에이전트 수를 절반으로 줄임.
주요 결과
- 7개 텍스트 기반 벤치마크에서 Co-RL은 4개의 LLMs를 평균 3.0–8.6% 개선.
- 4개 멀티모달 벤치마크(MathVision, MathVerse, MathVista, We-Math)에서 5개 VLMs를 평균 2.3–7.2% 개선.
- CoMAS 평가에서 기존 다중 에이전트 RL 방법 대비 4.0% 개선, 에이전트 수를 절반으로 줄임.
- 자기 평가 기반 기법 대비 0.8–2.0% 개선.
- 라벨 없이도 감독 학습과 유사하거나 더 높은 성능 달성.
의의 및 한계
Co-RL은 라벨 없이도 강화학습을 통해 모델의 추론 능력을 향상시키는 새로운 접근법을 제시한다. 기존 자기 평가 방식의 편향 강화 문제를 해결하고, 다양한 모델 간의 협력 학습을 통해 보다 안정적이고 다양성 있는 학습이 가능하다는 점에서 학술적·실용적 가치가 있다. 특히, Co-RL은 **GRPO**와 **REINFORCE++** 알고리즘을 활용해 정책 최적화를 수행하며, **majority voting**을 통해 가상 정답을 생성하는 방식이 학습 안정성에 기여한다.
그러나 Co-RL의 한계점도 명시된다. 예를 들어, 모델 간의 오류가 완전히 상관되지 않아야 효과가 극대화되는데, 이는 모델 다양성 확보에 큰 의존성을 띤다. 또한, 모델 간의 상호작용 구조(예: 에이전트 수, 상호작용 방식)에 따라 성능이 달라질 수 있으며, 이에 대한 심층적 분석은 아직 미흡하다는 점도 언급된다.
실용적 활용
Co-RL은 라벨이 부족하거나 인간 평가가 어려운 고급 추론 작업(예: 수학, 코드 생성, 멀티모달 추론)에 유용하게 적용될 수 있다. 특히, 대규모 언어 모델(LLM)과 비주얼-언어 모델(VLM) 모두에서 성능 향상을 보였기 때문에, 다양한 산업 분야에서 비감독 학습 기반의 추론 시스템 개발에 활용 가능하다.