- #1Programmable World Model
Programmable World Model은 자연어를 기반으로 세계 상태를 명시적으로 관리하고 생성하는 시스템으로, 94%의 Count Accuracy와 98%의 State Accuracy를 달성한다.
- #2DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments
DeepResearcher는 실제 웹 환경에서 강화학습을 확장하여 LLM 기반 연구 에이전트를 훈련하는 최초의 종단간 프레임워크로, 기존 방법 대비 최대 28.9점의 성능 향상을 보인다.
- #3Monitoring AI-Modified Content at Scale: A Case Study on the Impact of ChatGPT on AI Conference Peer Reviews
AI 생성 텍스트의 대규모 모니터링을 위한 최대우도 기반 추정 모델을 제안하고, AI 학회 리뷰 데이터를 통해 6.5~16.9%의 텍스트가 LLM에 의해 수정되었을 가능성을 분석한다.
- #4Many-Shot In-Context Learning
Gemini 1.5 Pro를 활용해 수천~수만 샷의 Many-Shot ICL을 실험하고, Reinforced 및 Unsupervised ICL을 제안하여 인간 라벨 의존도를 줄인다.
- #5Improving Video Generation with Human Feedback
182,000개의 인간 선호 데이터를 기반으로 Flow-DPO, Flow-RWR, Flow-NRG를 도입해 비디오 생성 모델의 정렬을 개선한다.
- #6Data Interpreter: An LLM Agent For Data Science
Data Interpreter는 데이터 과학 문제를 종단간 해결하는 LLM 에이전트로, 계층적 그래프 모델링과 프로그래밍 가능한 노드 생성을 통해 25% 이상의 성능 향상을 달성했다.
- #7Training Software Engineering Agents and Verifiers with SWE-Gym
SWE-Gym을 활용한 소프트웨어 엔지니어링 에이전트 학습 환경 구축과 32.0% 성능 달성.
- #8AlphaEdit: Null-Space Constrained Knowledge Editing for Language Models
AlphaEdit는 기존 지식을 유지하면서 LLM 편집 성능을 평균 36.7% 향상시키는 null-space 기반 편집 방법이다.
- #9Video Depth Anything: Consistent Depth Estimation for Super-Long Videos
Video Depth Anything는 초장시간 동영상에서도 깊이 추정의 일관성을 유지하면서 계산 효율성을 보장하는 모델이다.
- #10MUSE: Machine Unlearning Six-Way Evaluation for Language Models
MUSE는 언어 모델에서 데이터 제거 효과를 6가지 기준으로 평가하는 벤치마크로, 기존 알고리즘의 한계를 드러냄.
- #11Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning
PAV(Progress Advantage Verifier)를 사용한 프로세스 보상 최적화가 테스트 타임 검색과 온라인 RL에서 정확도와 계산 효율성을 동시에 향상시킨다.
- #284Show-Harness: Just a VLM Agent Can Play Robots
Show-Harness는 VLM을 통해 로봇을 제어할 수 있는 세마틱 인터페이스를 제공하여, 제로샷 및 저비용 배포가 가능하다.
- #294OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining
OpenWAM은 모듈화된 연구 스택을 통해 시스템적인 월드-액션 모델 사전학습을 구현한 오픈 프레임워크이다.
- #299Physics-informed neural networks by Gradient-Guided Gaussian Adaptive Sampling (3GAS-PINNs)
- #305Measuring Language Transfer in Robot Policies: Adding Greek to a Cosmos3 Vision-Language-Action Policy
로봇 정책에 그리스어를 추가할 때, 번역된 데이터만 사용해도 성능이 일부 개선되지만, 정확한 측정이 핵심 과제임을 밝혔다.
- #306AgenticGen: Reward-Guided Agentic Video Generation for Advertising
- #307SyncWorld: Visual Calibration Enables World Models as Zero-Shot Simulators
SyncWorld는 시각 교정을 통해 학습된 액션-시각 매핑을 기반으로, 추가 학습 없이 새로운 환경에서 제로샷 시뮬레이션을 수행하는 월드 모델이다.
- #308Valerant: An Automatic Navigable Game Map Generator via Action-Conditioned World Model Exploration
- #309From State Synchronization to Cognitive Self-Evolution: An Operational Architecture for Cognitive Digital Twins
4단계 CDT 아키텍처를 제안하여 인지 기능을 체계적으로 통합하고, 운영 효율성을 향상시킨다.
- #310Seven Sources of Physical AI Capability Formation
- #311AgentGrad: Intervention-guided Prompt Optimization for Multi Agent Systems
AgentGrad는 순차적 개입과 의미론적 텍스트 그라디언트 추상화를 통해 다중 에이전트 시스템의 프롬프트 최적화 성능을 2.5배 빠르게 개선하는 프레임워크다.
- #312Marigold V2: Revisiting Diffusion Transformers for Monocular Depth Estimation
Marigold V2는 Qwen-Image-Edit를 기반으로 2단계 학습 프로토콜을 통해 단일 이미지에서 고해상도 깊이 맵을 생성하는 확산 변형기 기반 모델로, KITTI와 ETH3D에서 AbsRel 기준 16-26% 개선된 성능을 보인다.
- #313StochBench: A Domain-Specific Benchmark for Stochastic Processes in Lean
StochBench는 Lean 4 기반의 확률과정 분야 대학원 수준 정리 450개를 포함한 도메인별 정리 증명 벤치마크로, Opus 4.8 기반 에이전트가 15분 제한 내 34.9% 증명 성공.
- #314Train Smarter, Not Harder: Switching Signal-Guided Training in Active Learning
HybridAL은 모델 경로의 안정화를 감지하여 재학습과 미세조정을 적응적으로 전환하는 활성 학습 전략으로, 49%의 시간 절약과 NLL 기반 교정 개선을 달성한다.
- #315VDiff-Bench: A Challenging Benchmark for Fine-Grained Image Difference Identification
VDiff-Bench는 MLLMs의 미세한 시각적 차이 인식 능력을 평가하기 위한 다중 선택형 벤치마크로, 10개의 변화 범주와 1,756개의 질문을 포함한다.
- #316RESCUE-BENCH: Towards Relation-Aware Multi-Party Emotional Support Conversation Systems
- #317WearableQA: A Benchmark for Health Reasoning over Real-World Wearable Data
WearableQA는 200명의 실제 사용자 데이터를 기반으로 건강 추론 능력을 평가하는 4,084개의 다중 선택형 질문을 포함한 새로운 벤치마크이다.
- #318What Did I Just Say? Self-Listening for Full-Duplex Speech Models
- #319SWE-Bench Pro Verified: A Reliable Benchmark for Software Engineering Agents
SWE-Bench Pro Verified는 기존 SWE-Bench Pro의 신뢰도 문제를 해결한 소프트웨어 엔지니어링 에이전트 평가 벤치마크이다.
- #320SAEScientist-Bench: Can AI Agents Conduct Autonomous SAE Interpretability Research?
AI 에이전트가 SAE 도구를 활용해 자율적으로 모델 해석 연구를 수행할 수 있는지 평가하는 벤치마크인 SAEScientist-Bench를 제안한다.