- #1ReferTrack: Referring Then Tracking for Embodied Visual Tracking
ReferTrack은 단일 전면 카메라 기반의 언어 지시 추적 문제를 해결하기 위해 언급 후 추적 방식을 도입한 VLA 모델로, EVT-Bench에서 최고 성능을 달성한다.
- #2FinanceComplexQA: Benchmarking Agentic Reasoning on Industrial-grade Financial Documents
FinanceComplexQA는 1009개의 실제 금융 문서를 기반으로 2,026개의 깊은 연구 질문을 포함한 금융 문서 QA 벤치마크로, Agent-as-a-Judge 평가를 통해 정확도와 추론력을 평가한다.
- #3TableVerse: A Large-scale Tabletop Dataset with Real-world Grounded Layouts for Generalizable Manipulation
TableVerse는 10만 개의 실제 기반 테이블탑 환경과 조작 트레젝토리를 포함한 대규모 데이터셋을 생성하는 자동화된 Real2Sim 파이프라인을 제시한다.
- #5AREX: Towards a Recursively Self-Improving Agent for Deep Research
AREX는 재귀적 자기 개선을 통해 깊은 연구 성능을 향상시키는 대형 언어 에이전트 시스템이다.
- #8K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs
K12-KGraph는 중국 교과서 기반의 과정 지식 그래프로, 교육용 LLM의 커리큘럼 인지 능력을 평가하고 훈련하는 데 활용된다.
- #9Multi-Turn On-Policy Distillation with Prefix Replay
ReOPD는 학습 비용을 4배 이상 절감하면서도 정확도를 유지하는 오프라인 멀티턴 온폴리시 디스틸레이션 방법이다.
- #11Visual Contrastive Self-Distillation
VCSD는 시각 정보의 조건 변화를 활용한 간단한 온-포로피 시스드(VCSD)로, 외부 티처 없이 모델 성능을 향상시킨다.
- #12Recurrent Sinusoidal INRs for Efficient High-Fidelity Representation
신경망의 파라미터 증가 없이 고주파 정보를 효과적으로 표현하는 반복 사인 활성화 기반 INR 구조를 제안한다.
- #14Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text
ProVisE와 SpatialGen-Bench를 통해 이미지 생성 모델의 시각적 공간 인지 평가가 가능해졌다.
- #15OpenForgeRL: Train Harness-native Agents in Any Environment
OpenForgeRL은 다양한 환경에서 하네스 기반 에이전트를 end-to-end로 학습할 수 있는 오픈소스 프레임워크로, 31.7 pass³ 등 여러 벤치마크에서 기존 모델을 능가한다.
- #19NVIDIA-labs OO Agents: Native Python Object-Oriented Agents
NVIDIA OO Agents(NOOA)는 AI 에이전트를 Python 객체로 표현하는 모델-비관련 프레임워크로, 개발자와 에이전트가 동일한 인터페이스를 공유하여 테스트 및 개선이 용이하다.
- #20Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction
Tencent WorkBuddy Bench는 코드, 웹, 오피스, 보안 4개 도메인에서 오염에 강한 코딩 에이전트 평가 벤치마크를 제공한다.
- #21SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation
SANA-Video 2.0은 5B 및 14B 규모의 하이브리드 어텐션 비디오 생성 모델로, 720p 영상 생성 시 3.2× 가속된 DiT 성능과 84.30의 VBench 점수를 달성한다.
- #22Color Pass-Through via Camera-Display Coupling
스마트폰 카메라와 디스플레이를 통합한 Color Pass-Through 프레임워크를 제안하여 실제 장면의 색감을 정확히 재현한다.
- #23LLMs Get Lost in Evolving User Intent
LLMs가 대화 중 사용자의 변화하는 의도를 효과적으로 추적하지 못한다는 문제를 밝혀낸 연구.
- #24Self-Supervised Learning of Structured Dynamics from Videos
SDM은 동결된 이미지 백본 위에 구축된 구조화된 동영상 역학 모델로, 미래 특징 예측을 통해 카메라 운동과 객체 운동을 분리한다.
- #26Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization
RIPO는 기하학적 불일치를 해결해 LLM RL에서 탐색 붕괴를 극복하고, AIME24에서 GRPO 대비 최대 60% 개선.
- #27Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers
WorldWeaver는 다중 에이전트 환경에서 일관된 세계 상태를 유지하는 스트리밍 비디오 확산 모델로, 세계 상태 레지스터와 Mixture-of-Transformers(MoT) 구조를 도입한다.
- #28Sample-Efficient Learning from Agent Experience
경험 기반 학습에서 샘플 효율성을 향상시키기 위한 Experience Distillation 방법을 제안한다.
- #29AutoIndex: Learning Representation Programs for Retrieval
AutoIndex는 BM25 기반 검색 성능을 향상시키기 위해 문서 표현 프로그램을 학습하는 프레임워크로, CRUMB 벤치마크에서 평균 +8.4%의 Recall@100 개선을 달성했다.
- #30Preference Tuning as Spectral Update Reorganization
RLHF와 선호도 최적화를 스펙트럼 구조로 분석하여 학습된 업데이트의 재구성 가능성을 밝혀낸 연구.
- #31Robostral Navigate
Robostral Navigate는 단일 RGB 카메라만 사용해 R2R-CE에서 77.4% 성공률을 달성한 8B 규모의 시각-언어 네비게이션 모델이다.
- #32Predictive Divergence Masks for LLM RL
PPO 기반 방향 기준의 한계를 보완한 predictive divergence mask를 제안하여 LLM RL의 훈련 안정성과 효과성을 개선한다.
- #33FVAttn: Adaptive Sparse Attention with Runtime Load Balancing for Video Generation
FVAttn은 다중 GPU 환경에서 실행 효율성을 향상시키는 적응형 희소 어텐션 시스템으로, 런타임 로드 밸런싱과 슬랙 인식 희소 증강을 통해 어텐션 속도를 4.41배 개선한다.
- #34ATSplat: Compact Feed-forward 3D Gaussian Splatting with Adaptive Token Expansion
ATSplat은 적응형 토큰 확장을 통해 3D Gaussian Splatting의 장점을 복원한 실시간 렌더링 성능을 갖는 컴팩트한 피드포워드 프레임워크이다.