한 줄 요약
CaSKG는 카운터패클-인과적 스킬 그래프를 통해 대규모 스킬 라이브러리에서 효과적인 스킬 검색을 가능하게 하는 프레임워크로, ALFWorld와 ScienceWorld에서 기존 방법 대비 8% 이상 성능 향상을 달성했다.
핵심 기여도
- CaSKG는 **Counterfactual-Causal Skill Graph (CaSKG)**라는 새로운 스킬 그래프 프레임워크를 제안하여, **고정밀 스킬 관계 추정**을 가능하게 함.
- **Direction-conditioned textual counterfactual probes**를 통해 스킬 쌍 간의 의존성을 정량적으로 평가하고, **Beta-smoothed posterior**로 신뢰도를 집계함.
- **ALFWorld ID-140**과 **ScienceWorld U211**에서 6개 LLM 백본을 기반으로 평가하여, GoS 대비 **ScienceWorld 80.50% (기존 72.62%)**, **ALFWorld 86.79% (기존 80.01%)** 성능 향상.
- **Mean environment steps** 감소를 통해 효율적인 상호작용을 보장함.
핵심 아이디어
기존 스킬 검색 방법은 텍스트 유사도나 그래프 구조만을 기반으로 하여, 절차적 의존성을 정확히 반영하지 못한다. CaSKG는 이 문제를 해결하기 위해 **스킬 간 인과적 관계를 카운터패클 분석을 통해 추정**하는 새로운 접근법을 제안한다.
CaSKG는 먼저 **semantic, lexical, input/output, structural** 신호를 기반으로 **고-리콜 후보 그래프**를 생성한다. 이후, **repair evidence**와 **LLM judge**를 활용해 후보 간 신뢰도를 조정한다. 핵심적으로, **direction-conditioned textual counterfactual probes**를 통해 스킬 쌍에 대해 **source 제거, 대체, 순서 반전** 실험을 수행하여, 의존성과 순서 의존성을 정량적으로 평가한다.
이러한 분석을 바탕으로 **Beta-smoothed posterior**를 사용해 각 엣지의 신뢰도를 계산하고, **state-filtered weighted graph**를 생성하여, **Personalized PageRank-style expansion**을 통해 최종 스킬 집합을 추출한다. 이는 기존 방법 대비 절차적 구조를 보존하면서도, 불필요한 스킬을 제거하여 **검색 효율성과 정확도를 동시에 향상**시킨다.
기술적 접근법
- **Skill Library**: 1,000개의 스킬로 구성된 **Skill1000** 라이브러리 사용.
- **Candidate Graph Construction**: **semantic, lexical, input/output, structural** 신호를 기반으로 **directed candidate graph** 생성.
- **Edge Calibration**: **direction-conditioned textual counterfactual probes** (source 제거, 대체, 순서 반전)를 통해 스킬 쌍 간 의존성 평가.
- **Edge Confidence Estimation**: **Beta-smoothed posterior**로 신뢰도 집계.
- **Graph Publication**: **confirmed, uncertain, rejected, unvalidated** 상태로 엣지 분류 후, **state-filtered weighted graph** 생성.
- **Retrieval**: **Personalized PageRank-style expansion**을 통해 **task-conditioned skill bundle** 추출.
- **Hyperparameters**: **Skill1000**, **ALFWorld ID-140**, **ScienceWorld U211**, 6개 LLM 백본 사용.
주요 결과
- **ScienceWorld U211**: GoS 대비 6개 모델의 **macro-average 성능 72.62 → 80.50** (7.88% 향상).
- **ALFWorld ID-140**: GoS 대비 6개 모델의 **성공률 80.01% → 86.79%** (6.78% 향상).
- **Mean environment steps**: 두 벤치마크에서 모두 감소 (정확한 수치는 명시되지 않음).
- **Ablation study**: **judge-assisted scoring**, **counterfactual correction**, **state-gated publication**이 성능에 긍정적 영향을 미침.
의의 및 한계
CaSKG는 대규모 스킬 라이브러리에서 **의존성 있는 스킬 집합을 효율적으로 검색**할 수 있는 새로운 프레임워크를 제시한다. 특히, **인과적 관계를 기반으로 한 엣지 신뢰도 조정**은 기존 텍스트 유사도 기반 검색의 한계를 극복하며, **복잡한 절차적 작업 수행에 필요한 구조적 정보를 보존**한다.
그러나, CaSKG는 **오프라인 그래프 생성**을 전제로 하므로, 실시간 업데이트가 필요한 환경에서는 한계가 있을 수 있다. 또한, **LLM judge**의 사용은 추가적인 계산 비용을 유발하며, **repair evidence**의 질에 따라 성능이 변동할 수 있다.
실용적 활용
CaSKG는 **로봇 제어**, **자율 시스템**, **대화형 AI** 등에서 **복잡한 절차를 수행하는 대형 언어 모델 에이전트**에 적용 가능하다. 특히, **다양한 도구와 API를 활용하는 환경**에서, CaSKG는 **필요한 스킬만을 정확하게 추출**하여 **작업 성공률과 효율성을 동시에 향상**시킬 수 있다.