Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction
Tencent WorkBuddy Bench Team, Siqi Cai, Shaopeng Chen, Xiang Fei, Yong Mao, Zihan Xu, Zhiheng Lyu, Zhijian Shao, Yuchen Shi, Shuwen Zhang, Chaofan Qiu, Linjie Che, Xiaoxi Zhao, Feng Wu, Kai Zhang, Chaofan Zhu, Yubin Qi, Xiaoyun Liang, Peijie Dong, Yunhao Zhang, Yuanjie Zhu, Ling Jiang, Xianjun Zhang, Zhehang Chu, Anyuan Sang, Zhen Feng, Sen Nie, Shi Wu, Yuanzhen Xu, Xin Li, Ning Yang, Zhiqiang Dong, Hande Dong, Qiang Lin, Yi Liu, Yunsheng Wu, Ke Li, Xing Sun
arXiv:2607.20911 · 2026-07-24 공개 · arXiv · PDF
code-generation coding-agents evaluation-framework multi-domain contamination-resistant task-construction reproducible workbench
Abstract
We introduce Tencent WorkBuddy Bench, a multi-domain evaluation suite for coding agents; this report documents its construction methodology, scoring protocol, and a cross-model leaderboard. At its core is a unified evaluation framework for constructing and running distribution-informed coding-agent tasks across four work domains - Code, Web, Office, and Security. Rather than adapting public issue text, every task is reverse-engineered from a real commit, pull request, or business scenario and rewritten as a short, colloquial, role-played request, so that a task's prompt is not recoverable by web-searching the underlying issue, pull request, or commit thread. Because the dataset is released openly - task directories, environment images, evaluation harness, tests, and reference solutions - contamination resistance rests on this construction together with dataset versioning rather than on secrecy. The four subsets - repository-level engineering, front-end development, office and business workflows, and red-/blue-team security - probe complementary facets of real work, each with its own verification style. All are packaged in a uniform task-directory format and run, under a uniform and reproducible protocol, on two agent harnesses (CodeBuddy Code and Claude Code); the full open release makes the benchmark reproducible end to end and directly auditable, since any third party can re-run each task and inspect its content. Because each subset uses a different scoring instrument, scores are not comparable across subsets and the suite reports no suite-wide average. We report a cross-model leaderboard across several model families.
한국어 요약
한 줄 요약
Tencent WorkBuddy Bench는 코드, 웹, 오피스, 보안 4개 도메인에서 오염에 강한 코딩 에이전트 평가 벤치마크를 제공한다.
핵심 기여도
- 4개 도메인(Code, Web, Office, Security)에 걸친 실제 업무 기반 코딩 에이전트 평가 프레임워크 제시.
- 각 태스크는 실제 커밋, 풀리퀘스트, 비즈니스 시나리오에서 역공학되어 웹 검색으로 복구 불가능한 방식으로 작성됨.
- 평가 환경, 테스트, 참조 솔루션 등이 완전히 공개되어 외부에서 재실행 및 검증 가능.
- CodeBuddy Code와 Claude Code 두 개의 에이전트 허네스를 사용한 교차 모델 리더보드 제공.
핵심 아이디어
Tencent WorkBuddy Bench는 기존 코딩 에이전트 평가 방식의 한계를 극복하기 위해 설계되었다. 기존의 SWE-bench와 같은 정적 벤치마크는 문제와 해결책이 공개되어 있어 모델이 단순히 문제를 암기하는 경향이 있다. 반면, Vendor 생산 벤치마크는 폐쇄적이라 외부 검증이 어렵다. 이에 따라, Tencent WorkBuddy Bench는 실제 업무에서 발생한 커밋, 풀리퀘스트, 비즈니스 시나리오를 역공학하여 각 태스크를 자연스럽고 역할놀이 기반의 요청으로 재구성함으로써, 웹 검색을 통한 정보 유출을 방지한다. 이는 평가의 신뢰성을 높이기 위한 핵심 설계 요소이다.
기술적 접근법
- **도메인**: Code(리포지토리 레벨 소프트웨어 엔지니어링), Web(프론트엔드 아티팩트), Office(다중 파일 업무 흐름), Security(보안 팀 활동)
- **태스크 생성**: 실제 커밋, 풀리퀘스트, 비즈니스 시나리오에서 역공학하여 자연스러운 요청으로 재구성.
- **평가 프로토콜**: 모든 태스크는 동일한 폴더 형식으로 패키징되며, CodeBuddy Code와 Claude Code 두 허네스에서 실행.
- **점수 산정**: Code는 히든 테스트, Web은 루브릭과 LLM/VLM 판정, Office는 LLM 판정, Security는 결정론적 점수.
- **공개성**: 태스크 디렉토리, 환경 이미지, 평가 허네스, 테스트, 참조 솔루션이 모두 공개되어 외부 검증 가능.
주요 결과
- **리더보드**: Claude Opus 4.8가 Code(74.43, 77.90), Web(68.14, 69.86)에서 1위, GLM-5.2가 Security(76.32, 80.86)에서 1위.
- **Code vs. Data & Algorithm**: Data & Algorithm 태스크는 평균 74%로, Coding 태스크(65%)보다 높게 평가됨.
- **보안 태스크 거부**: 일부 보안 요청에 Claude Opus 4.8가 13건, GPT-5.5가 2건의 거부 기록 보유.
- **허네스 민감도**: Security는 평균 점수 차이가 8.6점으로 가장 큼. Office는 0.86점 미만으로 가장 낮음.
의의 및 한계
Tencent WorkBuddy Bench는 실제 업무 환경에서 코딩 에이전트의 성능을 정확히 평가할 수 있는 체계적인 프레임워크를 제공한다. 특히, 웹 검색을 통한 정보 유출을 방지한 태스크 설계와 완전한 공개성은 평가의 신뢰도를 높인다. 그러나 각 도메인별 점수는 비교 불가능하며, 전체 평균 점수를 제공하지 않는 점은 한계로 작용할 수 있다. 또한, 일부 보안 요청에 대한 거부 현상은 모델의 제약을 드러내며, 이는 추가 연구의 필요성을 제시한다.
실용적 활용
Tencent WorkBuddy Bench는 실제 조직 내에서 사용되는 코딩 에이전트의 성능을 평가하는 데 활용할 수 있다. 특히, 개발, 웹 개발, 오피스 업무, 보안 분야에서 모델의 실무 적응력을 측정하여, 기업의 AI 도입 결정에 실질적인 근거를 제공할 수 있다.