한 줄 요약
BDH-CQ는 150M 파라미터로 ARC-AGI-1에서 29.5% pass@2를 달성한, 반복적 잠재 공간 추론과 인-컨텍스트 학습을 결합한 새로운 추론 모델이다.
핵심 기여도
- BDH-CQ는 반복 메모리 업데이트와 고차원 잠재 공간에서의 반복 추론을 결합한 첫 모델.
- 150M 파라미터로 ARC-AGI-1에서 29.5% pass@2를 달성하며, 추론 비용은 $0.00070 per task.
- ARC-유사 실험을 통해 개념별로 추론 성능과 실패 원인을 분석.
- 시연 조건에 따른 연산 스키마를 도입, 규칙 적용 일관성과 조합 가능성 평가.
핵심 아이디어
BDH-CQ는 기존의 CoT 추론 방식과 달리, 추론 과정을 언어화하지 않고 고차원 잠재 공간에서 반복적으로 계산하는 새로운 접근법을 제시한다. 모델은 추론 시점에 주어진 입력을 반복 메모리에 지속적으로 업데이트하고, 이를 기반으로 고차원 잠재 공간에서 반복적 연산을 수행한다. 이는 자연어 토큰을 필수적인 계산 표현 방식으로 삼지 않음으로써, 부분적 가설이나 변환 후보를 직렬화하지 않고 유지할 수 있게 한다.
또한, BDH-CQ는 시연을 통해 새로운 변환을 학습하지만, 추론 시점에 파라미터 업데이트 없이 메모리만 업데이트하는 구조를 채택한다. 이는 기존의 CoT나 강화 학습 기반 모델과 구조적으로 차별화되며, 추론 과정의 비용 효율성을 높이는 핵심 아이디어이다.
기술적 접근법
- **모델 구조**: 150M 파라미터의 BDH-CQ는 반복 메모리 업데이트와 고차원 잠재 공간에서의 반복 추론을 결합.
- **추론 과정**: 시연 시점에 입력이 반복 메모리에 업데이트되고, 추론은 고차원 잠재 공간에서 반복적으로 수행됨.
- **데이터셋**: ARC-AGI-1 평가셋과 컨트롤된 ARC-유사 데이터를 사용.
- **추론 비용**: $0.00070 per task로, 기존 모델 대비 10분의 1 미만의 비용.
- **학습 전략**: 시연 기반 학습을 사용하지만, 추론 시점에는 파라미터 업데이트 없이 메모리만 업데이트.
주요 결과
- **ARC-AGI-1**: 150M 파라미터 BDH-CQ는 29.5% pass@2 성능을 달성.
- **비용 효율성**: $0.00070 per task로, 기존 비용-정확도 파레토 최전선을 돌파.
- **컨트롤 실험**: 색상 매핑, 경계 확장, 순서 정렬, 중첩 구조 등에서 일관성 있는 규칙 적용과 실패 원인 분석 가능.
- **조합 가능성**: 회전과 이동은 72개 테스트 중 72개에서 성공, 반사와 색상 교환은 47/72, 0/72 성공.
의의 및 한계
BDH-CQ는 추론 과정을 언어화하지 않는 방식으로, 추론 비용을 기존 모델 대비 10분의 1 수준으로 줄이며, 비용 효율성 측면에서 새로운 기준점을 제시한다. 또한, 시연을 통해 학습된 변환을 일관되게 적용하고, 개념별 성능을 분석하는 새로운 실험 프레임워크를 제시한다.
하지만, 일부 복잡한 중첩 구조나 특정 색상 레이아웃 외부에서는 성능이 저하되며, 이는 시연 샘플의 범위와 표현 방식에 의존한다는 한계를 드러낸다. 또한, 모델 확장 및 더 복잡한 추론 작업에 대한 연구는 아직 진행 중이다.
실용적 활용
BDH-CQ는 저비용으로 복잡한 추론 작업을 수행할 수 있어, 자동화된 시스템, 인공지능 기반 교육 플랫폼, 시각적 추론 기반의 로봇 제어 등에 활용 가능하다. 특히, 추론 과정을 언어화하지 않는 방식은 대규모 추론 작업의 효율성 향상에 기여할 수 있다.