Training Software Engineering Agents and Verifiers with SWE-Gym

Jiayi Pan, Xingyao Wang, Graham Neubig, N. Jaitly, Heng Ji, Alane Suhr, Yizhe Zhang

arXiv:2412.21139 · 2026-07-27 공개 · arXiv · PDF

code-generation language-models swe-bench software-engineering agent-training natural-language-processing python trajectory-learning

Abstract

We present SWE-Gym, the first environment for training real-world software engineering (SWE) agents. SWE-Gym contains 2,438 real-world Python task instances, each comprising a codebase with an executable runtime environment, unit tests, and a task specified in natural language. We use SWE-Gym to train language model based SWE agents, achieving up to 19% absolute gains in resolve rate on the popular SWE-Bench Verified and Lite test sets. We also experiment with inference-time scaling through verifiers trained on agent trajectories sampled from SWE-Gym. When combined with our fine-tuned SWE agents, we achieve 32.0% and 26.0% on SWE-Bench Verified and Lite, respectively, reflecting a new state-of-the-art for open-weight SWE agents. To facilitate further research, we publicly release SWE-Gym, models, and agent trajectories.

한국어 요약

한 줄 요약

SWE-Gym을 활용한 소프트웨어 엔지니어링 에이전트 학습 환경 구축과 32.0% 성능 달성.

핵심 기여도

핵심 아이디어

SWE-Gym은 기존 SWE-Bench와 달리 실행 가능한 런타임 환경, 단위 테스트, 자연어로 명시된 태스크를 포함한 실제 소프트웨어 엔지니어링 환경을 제공한다. 이는 기존 학습 환경이 의존하는 합성 데이터나 단일 태스크 중심의 문제를 극복한다. 핵심 아이디어는 **에이전트-환경 상호작용 트래젝토리**를 기반으로 **자연스러운 학습 신호**를 생성하여, 언어 모델이 실제 개발 환경에서의 문제 해결 능력을 향상시키는 것이다. 특히, **SWE-Gym의 실행 환경**은 테스트 실패/성공 여부를 명확히 제공하여, 보상 신호를 학습에 반영할 수 있다.

기술적 접근법

주요 결과

의의 및 한계

SWE-Gym은 기존 SWE-Bench가 제공하지 못한 실행 환경과 보상 신호를 포함한 **실무 중심 학습 환경**을 제공하며, 오픈웨이트 기반 에이전트의 성능 기준을 제시한다. 또한, **트래젝토리 기반 학습**과 **베리파이어 활용**은 인퍼런스 타임 성능 향상을 가능하게 한다. 그러나 현재 학습 성능은 **트래젝토리 샘플링 컴퓨팅 리소스**에 제한되며, 더 많은 데이터나 컴퓨팅이 추가될 경우 성능이 지속적으로 향상될 것으로 예상된다.

실용적 활용

SWE-Gym은 오픈소스 레포지토리에서 발생하는 실제 개발 문제를 해결하는 자동화 에이전트 개발에 활용 가능하다. 특히, **소프트웨어 유지보수**, **버그 수정**, **테스트 자동화** 등에 적용할 수 있으며, **모델 학습 및 평가 프레임워크**로도 활용 가능하다.