한 줄 요약
로봇 정책에 그리스어를 추가할 때, 번역된 데이터만 사용해도 성능이 일부 개선되지만, 정확한 측정이 핵심 과제임을 밝혔다.
핵심 기여도
- 그리스어로 번역된 데이터만 사용해 Cosmos3 정책에 언어 전이를 시도함.
- 단일 목표 벤치마크에서 정확한 그리스어 지시와 의도적으로 잘못된 지시 모두 84.6%와 82.6% 성공률로 언어 무시 경향 확인.
- 다국어 텍스트 타워만 사용해도 성능은 잘못된 지시 수준에 머무르며, 그리스어로 훈련하면 최대 2.7점 개선.
- 90개 작업에서 이분법적 성공률 분포를 관찰하며, 일부 작업은 모든 시드에서 실패함.
핵심 아이디어
기존 영어 중심의 로봇 정책에 그리스어를 추가하는 데 기계 번역된 데이터만을 사용하고, 모델 아키텍처는 변경하지 않았다. 핵심 문제는 번역이 아니라 **측정**이었다. 기존 벤치마크는 언어를 무시하는 경향이 있어, 정확한 성능 평가가 어려웠다. 특히, 색상 히스토그램 기반 메트릭은 노이즈에 속하기도 했으며, 단일 실행 비교는 시드에 따라 결과가 크게 달라졌다. 따라서, **언어를 무시하는 정책의 제로-베이스 성능**(null baseline)을 구축하고, 이를 기반으로 실험을 재현하는 것이 필수적임을 강조했다.
기술적 접근법
- **Cosmos3** 스택 사용: 영어 중심 2B 텍스트 타워와 다국어 8B 비전-언어 타워 모델 두 가지 버전.
- 정책은 **LeRobot** 형식의 시연 데이터셋으로 **임상 훈련**(imitation learning)됨.
- 평가는 **LIBERO 시뮬레이터**에서 **50회 시도당 500 에피소드**로 진행.
- 3가지 조건 평가: 올바른 영어 지시, 올바른 그리스어 지시, 잘못된 그리스어 지시.
- **7가지 표현 방식**으로 훈련하면 번역기 의존도가 반으로 줄음.
- **언어-적응 월드 모델 초기화**와 **텍스트 타워 unfreezing**은 성능 저하를 유발함.
주요 결과
- 단일 목표 벤치마크에서 정확한 그리스어 지시: 84.6%, 잘못된 지시: 82.6% → 언어 무시 경향.
- 90개 작업에서 그리스어 훈련 정책은 제어 정책 대비 6.7~7.1점 개선.
- 단일 언어 훈련 정책은 최대 2.7점 개선에 그침.
- 10개 목표 작업에서 성공률은 이분법적 분포: 0.72~0.98과 0.00~0.24 구간.
- 3개 시드에서 실패 작업은 시드에 따라 달라짐.
의의 및 한계
이 연구는 **저자원 언어로 로봇 정책을 로컬라이즈하는 데 필요한 측정 기법**을 강조한다. 기존 메트릭은 신뢰할 수 없고, **제로-베이스 성능**(null baseline)을 구축해 실험을 재현하는 것이 필수적이다. 또한, 다국어 타워만 사용해도 성능은 개선되지 않으며, **목표 언어 데이터가 필수적**임을 밝혔다. 한계로는 번역기의 표현 방식에 과적합되는 경향이 있으며, 언어-적응 월드 모델 초기화는 성능을 저하시키는 것으로 나타났다.
실용적 활용
이 연구는 **다국어 로봇 정책 개발**에 있어, 번역된 데이터만으로도 일부 성능을 얻을 수 있음을 보여주며, 특히 **저자원 언어 환경**에서 유용하다. 연구자는 **다국어 타워 선택**, **목표 언어 데이터 제공**, **제로-베이스 성능 측정**을 필수 단계로 제시하며, 번역기 의존도를 줄이기 위해 **다양한 표현 방식으로 훈련**하는 전략도 제안한다.