- #1Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill
Spark-to-Paper는 기존 코드 어시스턴트 내에서 13개의 구성 가능한 스킬을 통해 연구 아이디어를 종단간 논문으로 생성하는 시스템이다.
- #2Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model
Open-Reasoner-Zero는 Qwen2.5-32B 기반 모델에 PPO와 GAE를 적용해 1/10의 학습 스텝으로 AIME2024, MATH500, GPQA Diamond에서 DeepSeek-R1-Zero를 상회하는 성능을 달성한 오픈소스 RL 구현이다.
- #3Mean Flows for One-step Generative Modeling
MeanFlow는 1-NFE로 ImageNet 256x256에서 FID 3.43를 달성한 원스텝 생성 모델링 프레임워크다.
- #4Why Do Multi-Agent LLM Systems Fail?
다중 에이전트 LLM 시스템(MAS) 실패 원인을 체계적으로 분석한 실험적 실패 분류체계(MAST)와 대규모 데이터셋(MAST-Data)를 제시한다.
- #5The WMDP Benchmark: Measuring and Reducing Malicious Use With Unlearning
WMDP 벤치마크와 RMU 방법을 통해 대형 언어 모델의 악용 가능 지식을 평가하고 제거하는 기술적 접근을 제시한다.
- #6Contrastive Preference Optimization: Pushing the Boundaries of LLM Performance in Machine Translation
13B 규모의 ALMA 모델에 Contrastive Preference Optimization(CPO)를 적용해 GPT-4와 WMT 우승 모델과 유사한 번역 성능 달성.
- #7Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models
Prometheus 2는 직접 평가와 순위 평가 모두에서 GPT-4 수준의 성능을 보이는 오픈소스 평가 언어 모델이다.
- #8ComBodied Agents: a New Paradigm of Human-Centric Agentic AI
Combodied Agents는 인간의 상태와 자율성을 중심으로 한 새로운 Agentic AI 패러다임으로, 개인의 장기적 이익을 지속적으로 지원한다.
- #9TimeXer: Empowering Transformers for Time Series Forecasting with Exogenous Variables
TimeXer는 외부 변수를 효과적으로 통합하여 Transformer 기반 시계열 예측 성능을 향상시키는 새로운 모델이다.
- #10Poly Kernel Inception Network for Remote Sensing Detection
PKINet은 다중 스케일 커널과 CAA 모듈을 결합하여 원격 감지 이미지의 객체 탐지 성능을 향상시킨다.
- #11Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion
Self Forcing은 자동회귀 비디오 디퓨전 모델의 트레인-테스트 갭을 해소하는 새로운 훈련 패러다임으로, 실시간 스트리밍 생성을 가능하게 한다.
- #12WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs
WildGuard는 LLM 안전성 모니터링을 위한 다중 작업 오픈 소스 도구로, 13개 위험 범주에서 뛰어난 성능을 보인다.
- #298SkillZip: Contract-Preserving Graph Compression for Scalable Agent Skill Libraries
SkillZip은 실행 계약을 보존하면서 실행 그래프를 압축하는 스케일러블 에이전트 스킬 라이브러리 시스템이다.
- #304Articulated Object Reconstruction from Rest-State Observation
Rest2Art는 단일 닫힌 상태에서 관절 구조와 3D 기하학을 복원하는 새로운 아티큘레이션 객체 재구성 프레임워크이다.
- #305Beyond Pixels: From Video Priors to 4D Worlds
Latent-to-4D는 VAE 공유 공간 내의 비디오 레이턴트를 직접 4D 생성에 연결하여 기존 방식의 한계를 극복한다.
- #306OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution
OpenART는 복잡하고 진화하는 환경에서 에이전트 안전성을 평가하기 위한 대규모 레드팀 테스트 플랫폼으로, 환경 진화를 통해 85.0%의 공격 성공률을 달성한다.
- #307Self-Evolving Embodied Agents via Skill-Harness Evolution
SHAPER는 모델 파라미터를 고정한 채, 재사용 가능한 스킬과 컨텍스트-코드 헤이버스를 진화시켜 자율적으로 적응하는 임베디드 에이전트를 구현하는 프레임워크이다.
- #308Co-Evolution in Agentic Systems: Toward Self-Directed Evolution Beyond Human Design
본 논문은 에이전트 시스템에서의 공동진화(co-evolution)를 다층적 세 단계 분류로 체계화하고, 인간 설계를 벗어난 자기 주도적 진화의 가능성을 탐색한다.
- #309From Synthesis to Removal: Physics-Grounded Reflection Simulation and Diffusion-Based Video Dereflection
유리 표면 반사 제거를 위한 물리 기반 시뮬레이션과 확산 모델 기반 비디오 반사 제거 프레임워크를 제안한다.
- #310AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses
강력한 모델이 추론 시점에서 약한 모델의 성능을 0.49에서 0.91로 향상시키는 추론 환경 설계 방법을 제안한다.
- #311Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustness
Decoding-Level Taboo는 생성 경로를 강제로 변경하여 LLM의 실제 세계 내구성을 진단하는 런타임 로짓 공간 개입 기법이다.
- #312Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence
Mechanist는 AI 모델의 작동 메커니즘을 자동으로 탐색하는 시스템으로, 13,000개 논문 기반 지식그래프와 32개 메커니즘 해석 방법을 활용한다.
- #313AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models
AtlasVLA는 단일 워리스트 카메라로 장기적 작업을 수행하는 데 있어 지속적 세계-자기 상태를 모델링하여 기존 VLA 모델의 한계를 극복한 새로운 프레임워크이다.
- #314Federated Learning for Distributed CNC Tool Wear Prediction
분산된 CNC 공작기계 데이터 환경에서 툴 마모 예측을 위한 연방학습 프레임워크를 제안하고 MATWI 데이터셋을 기반으로 성능 검증.
- #315Hand Visibility Detector: Per-Keypoint Visibility Estimation for Hands
손 관절별 가시성 추정을 위한 독립적 모델인 Hand Visibility Detector를 제안하고, 3D 손 포즈 추정에서 재투영 오류 감소를 실증적으로 보인다.
- #316AutoWorldModel-Bench: A State-Centric Benchmark for Automated World-Model Research
AutoWorldModel-Bench는 8개 게임 환경에서 AI 코드 에이전트가 세계 모델을 자율적으로 개선하는 데 사용되는 폐쇄 루프 벤치마크이다.
- #317Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives
LLM 에이전트가 장기적 스토리 일관성을 유지하는지 평가하는 NCP-Bench 벤치마크를 제안하며, GPT-5.2 포함 주요 모델이 40~68%의 사실 충돌률을 보임.
- #318Mendel G\"odel Machine: Recursive Self-Improving Coding Agents via Comparative Evolution
Mendel G\"odel Machine(MGM)은 비교적 신뢰성 높은 자기 개선 전략을 통해 코드 에이전트 성능을 50.8%에서 93.3%까지 향상시킨다.
- #319AdvFD: Boosting Visual Generation via Adversarial Fr'echet Distance Loss
AdvFD는 정적 특징 공간의 한계를 극복하기 위해 적대적 학습을 통한 Fréchet 거리 최적화를 제안하여 시각 생성 품질을 향상시킨다.
- #320StateFlow: Building, Evolving, and Accessing 3D World States for Previsualization
StateFlow는 편집 가능한 3D 월드 상태를 기반으로 프리비주얼라이제이션을 구축하고 진화시키는 상태 중심 프레임워크이다.