한 줄 요약
Spider 2.0은 632개의 실제 기업 데이터베이스 워크플로우를 기반으로, 기존 텍스트-투-SQL 벤치마크보다 훨씬 복잡한 SQL 생성과 다이얼렉트 이해를 요구하는 새로운 평가 프레임워크이다.
핵심 기여도
- Spider 2.0은 632개의 실제 기업 수준 데이터베이스 워크플로우를 포함하며, 평균 812개의 컬럼을 가진 대규모 스키마를 사용.
- 평균 144 토큰, 100줄 이상의 복잡한 SQL 쿼리를 생성해야 하며, 다양한 SQL 다이얼렉트(예: BigQuery, Snowflake)를 다루는 능력이 필요.
- 기존 텍스트-투-SQL 모델(o1-preview 기반 코드 에이전트)의 성능은 21.3%로, Spider 1.0(91.2%) 및 BIRD(73.0%) 대비 현저히 낮음.
- Spider 2.0-lite와 Spider 2.0-snow와 같은 하위 데이터셋을 제안, 기존 텍스트-투-SQL 파서와 비교 실험 가능.
핵심 아이디어
Spider 2.0은 기존 텍스트-투-SQL 벤치마크가 간단한 SQL과 소규모 스키마에만 집중한 반면, 실제 기업 환경에서는 다양한 데이터베이스 시스템, 복잡한 다이얼렉트, 대규모 스키마, 프로젝트 레벨 코드베이스와의 상호작용이 필요하다는 점을 반영한 새로운 평가 프레임워크이다.
이를 위해 실제 산업용 데이터베이스(예: Google Analytics, Salesforce)를 기반으로 구성되며, SQL 생성 과정에서 외부 문서, 메타데이터, 코드베이스를 참조해야 하는 다단계 작업이 요구된다.
예를 들어, SQL 쿼리는 단순히 질문을 해석하는 것을 넘어, 데이터 전처리, 변환, 분석까지 포함하며, 이는 기존 텍스트-투-SQL 작업과는 차원이 다르다.
기술적 접근법
- Spider 2.0은 실제 기업 데이터베이스(예: BigQuery, Snowflake, SQLite)에서 수집된 632개의 워크플로우를 포함하며, 평균 812개의 컬럼을 가진 대규모 스키마를 사용.
- SQL 쿼리는 평균 144 토큰, 100줄 이상으로 구성되며, 고급 함수(예: `ST_DISTANCE(x1, x2)`)를 포함.
- 평가 시나리오는 Spider 2.0, Spider 2.0-lite, Spider 2.0-snow로 나뉘며, 각각 코드베이스, 외부 문서, SQL 다이얼렉트 차이에 따라 복잡도가 달라짐.
- 실험에 사용된 모델은 o1-preview, o3-mini, GPT-4o, Claude-3.5-Sonnet, DeepSeek-V3, SFT CodeS-15B 등이며, Spider-Agent라는 코드 에이전트 프레임워크를 통해 평가됨.
주요 결과
- o1-preview 기반 코드 에이전트는 Spider 2.0에서 21.3%의 성공률을 기록, Spider 1.0(91.2%) 및 BIRD(73.0%) 대비 현저히 낮음.
- Spider 2.0-lite에서 DAIL-SQL + GPT-4o는 5.68%의 실행 정확도(EX)를 기록, Spider 1.0 대비 80% 이상 하락.
- Spider 2.0-snow에서 최고 성능은 2.20% EX로, SQL 다이얼렉트 차이로 인한 추가 어려움이 드러남.
- SFT CodeS-15B는 Spider 2.0-lite에서 0.73% EX로, 기존 텍스트-투-SQL 데이터셋과의 복잡도 차이가 극심함.
의의 및 한계
Spider 2.0은 기존 텍스트-투-SQL 평가가 실제 기업 환경을 반영하지 못한 점을 보완하며, 복잡한 SQL 생성, 다이얼렉트 이해, 코드베이스 탐색 등 실제 엔터프라이즈 워크플로우를 시뮬레이션하는 데 중요한 역할을 한다.
하지만, 기존 LLM 기반 코드 에이전트는 외부 문서 해석, 중첩 스키마 이해, 다중 SQL 쿼리 생성 등에서 여전히 한계가 있으며, 이는 기업 수준 SQL 전문가 역할 수행에 필요한 핵심 능력이다.
또한, 실험에서 제공된 오라클 함수 문서가 성능 개선에 거의 기여하지 못한 점은, LLM이 단순히 함수를 선택하는 것 이상의 복잡한 추론 능력이 필요하다는 것을 시사한다.
실용적 활용
Spider 2.0은 데이터 엔지니어링, 비즈니스 인텔리전스, 데이터 분석 등 기업 내 다양한 SQL 기반 워크플로우 자동화에 적용 가능하다.
특히, 대규모 데이터베이스와 복잡한 SQL 다이얼렉트를 다루는 환경에서 LLM 기반 코드 에이전트의 성능 향상을 위한 연구와 개선 방향을 제시할 수 있다.
이를 통해 기업은 반복적인 SQL 작업을 자동화하고, 데이터 전문가의 부담을 줄이는 데 기여할 수 있다.