한 줄 요약
ExplorationBench는 AI 시스템의 탐색 능력을 측정하기 위한 새로운 벤치마크로, AlienCode와 AlienLogic이라는 2개의 실행 가능한 환경을 통해 새로운 가설을 발견하고 적용하는 능력을 평가한다.
핵심 기여도
- AlienCode(31개 발견 목표, 70개 태스크)와 AlienLogic(24개 발견 목표, 70개 태스크)라는 2개의 실행 가능한 환경을 제시.
- 각 환경은 오류가 있는 매뉴얼, 태스크별 환경 피드백, 전용 툴 호출 스키마를 제공.
- 10개 AI 시스템을 평가한 결과, 최고 성능 시스템은 4라운드 탐색 후 AlienCode에서 87.6% 정확도 달성.
- 탐색 능력은 태스크별로 차이가 크고, 규칙을 발견했다고 하더라도 70.9%만 정확히 적용.
핵심 아이디어
기존 평가 방식은 AI가 기존 지식을 단순히 회상하는 경우를 구분하지 못해 탐색 능력을 정확히 평가하기 어려웠다. ExplorationBench는 이 문제를 해결하기 위해 "Alien Worlds"라는 실행 가능한 환경을 도입했다. 이 환경의 규칙은 사용자에게 제공된 매뉴얼과 상반되며, AI가 직접 탐색을 통해 규칙을 발견하고 이를 새로운 태스크에 적용해야 한다. AlienCode에서는 정수 리터럴이 27과 XOR되어 출력되거나, PLUCK 함수가 0이 아닌 1부터 카운트하는 등, 사용자의 사전 지식과 충돌하는 규칙이 설계되어 있다. 이는 AI가 단순히 기억한 정보를 사용하지 않고, 새로운 규칙을 탐색하고 적용하는 능력을 평가할 수 있도록 한다.
기술적 접근법
- **AlienCode**: 31개의 발견 목표와 70개 태스크로 구성된 작은 프로그래밍 언어.
- **AlienLogic**: 24개의 발견 목표와 70개 태스크로 구성된 자연 추론 시스템.
- 각 환경은 **flawed manual**, **task-specific feedback**, **tool-call schema**를 제공.
- AI는 4라운드 동안 탐색 후, 툴 접근 없이 70개의 held-out 태스크를 해결.
- 성능 평가 지표: Best@3 (3개 탐색 경로 중 최고 정확도), Mean@n, 최저 정확도.
- **Milestone curves**를 통해 탐색 과정에서 규칙을 발견하고 적용하는 능력을 추적.
주요 결과
- AlienCode에서 4라운드 탐색 후 최고 성능 시스템은 87.6% 정확도 달성.
- 환경 피드백 없이 동일한 수의 턴을 수행하면 정확도는 0.5–11.0%에 불과.
- AI가 스스로 실험을 설계하는 경우 정확도가 더 높았으며, 랜덤 실험은 거의 도움이 되지 않았음.
- AlienCode의 70개 태스크 중 51개는 off-by-one 규칙과 관련되어 있었고, 규칙 발견 시 정확도가 급증.
- AlienLogic에서는 규칙이 제공되면 93–97% 정확도 달성, 반면 탐색만으로는 달성 불가.
- 탐색 경로는 불안정하며, 동일한 AI가 동일한 예산 하에 72.8점 차이로 끝나는 경우도 있음.
의의 및 한계
ExplorationBench는 AI가 새로운 환경에서 탐색을 통해 지식을 생성하고 적용하는 능력을 정량적으로 평가할 수 있는 첫 번째 시도이다. 특히, 실행 가능한 규칙과 정확한 피드백을 통해 "실제 발견"과 "단순 추측"을 구분할 수 있다. 그러나 탐색 능력은 태스크별로 크게 변동하며, 규칙을 발견했다고 해서 반드시 적용하는 것은 아니라는 한계가 있다. 또한, 탐색 과정이 불안정하고, 동일한 AI가 동일한 예산 하에 다른 결과를 내는 경우가 있어, 탐색의 신뢰성을 높이는 방법이 필요하다.
실용적 활용
ExplorationBench는 과학적 발견, 엔지니어링, 복잡한 시스템 설계 등에서 AI가 새로운 환경을 탐색하고 지식을 생성하는 능력을 평가하는 데 활용될 수 있다. 특히, AI가 실행 가능한 규칙을 기반으로 새로운 가설을 제시하고 이를 검증하는 능력을 테스트할 수 있어, 연구 개발 및 산업 현장에서의 AI 활용도를 높이는 데 기여할 수 있다.