한 줄 요약
WideSWE는 여러 레포지토리 간 조율이 필요한 실제 개발 작업을 평가하는 벤치마크로, 최대 42.50%의 작업 성공률을 보임.
핵심 기여도
- 103개 소프트웨어 생태계에서 120개 실제 작업을 추출한 WideSWE 벤치마크 제안.
- 요구사항과 테스트 간 불일치를 규칙 기반 수동 수정으로 해결.
- 7개 에이전트 구성에서 Codex CLI–GPT-5.6-sol이 42.50% 성공률로 가장 높음.
- 독립 실행 대비 공동 실행이 작업 완료에 더 효과적임을 실증.
핵심 아이디어
기존 평가가 단일 레포지토리에 집중한 반면, WideSWE는 여러 레포지토리 간 조율이 필요한 작업을 평가하는 새로운 접근법을 제시한다. 예를 들어, Sentry의 다중 SDK 작업이나 Godot/Native 작업처럼 여러 레포지토리에서 변경이 필요한 실제 상황을 반영한 작업을 설계했다. 작업 성공은 모든 대상 레포지토리에서 F2P 및 P2P 테스트가 통과할 때만 인정되며, 이는 기존 평가 방식과 구별된다. 또한, 작업 요구사항과 테스트 간 불일치를 해결하기 위해 규칙 기반의 수동 테스트 수정을 도입하여, 다양한 올바른 구현을 허용하면서도 요구 사항을 유지하도록 했다.
기술적 접근법
- **WideSWE 작업 구성**: 103개 소프트웨어 생태계에서 120개 작업을 추출 (60개 버그 수정, 60개 기능 추가).
- **작업 프롬프트 생성**: 관련 이슈와 PR에서 도출.
- **테스트 수정**: F2P와 P2P 테스트를 검토하여 요구사항과 일치하도록 조정.
- **평가 메트릭**: 모든 대상 레포지토리에서 테스트가 통과하면 작업 성공으로 간주.
- **실험 설정**: 7개 에이전트 구성 (예: Codex CLI–GPT-5.6-sol, Claude Code–Qwen 등) 비교.
- **실행 방식 비교**: 공동 실행 (joint execution) vs. 독립 실행 (independent execution) 비교.
주요 결과
- **Codex CLI–GPT-5.6-sol**: 42.50% 작업 성공률 (7개 구성 중 최고).
- **버그 수정 vs. 기능 추가**: Claude Code–Qwen은 버그 수정에서 우수 (42.86%)하지만, 기능 추가에서는 GPT-Opus (28.00%)보다 낮음.
- **실행 방식 비교**: 89개 동일 작업에서 공동 실행 36개 성공, 독립 실행 32개 성공 (20개 결과 반전).
- **실패 원인**: 필요한 변경사항을 인식하지 못하거나, 일부 작업만 수행한 경우가 많음.
의의 및 한계
WideSWE는 단일 레포지토리 중심 평가에서 벗어나, 실제 개발 환경에서 요구되는 다중 레포지토리 간 조율 능력을 평가하는 새로운 기준을 제시한다. 특히, 공동 실행이 관련 레포지토리 정보를 활용해 구현과 검증을 돕는다는 점에서 실용적 가치가 있다. 그러나 42.50%의 최고 성공률은 여전히 낮아, 에이전트가 전체 작업 범위를 정확히 파악하고 실행하는 능력이 한계라는 점을 보여준다. 또한, 작업 유형 (버그 vs. 기능)과 언어 다양성에 따라 성능 차이가 크므로, 이에 대한 추가 연구가 필요하다.
실용적 활용
WideSWE는 다중 레포지토리 기반의 소프트웨어 개발 프로젝트 (예: Sentry, Kubernetes)에서 에이전트의 협업 능력을 평가하는 데 활용 가능하다. 또한, 공동 실행 방식은 팀 개발 환경에서 정보 공유와 작업 조율을 지원하는 시스템 설계에 참고가 될 수 있다.