- #1A Graph Neural Network approach to zero-shot Digital Twins
제로샷 디지털 트윈을 위한 열역학 기반 그래프 신경망 프레임워크를 제안한다.
- #2ReferTrack: Referring Then Tracking for Embodied Visual Tracking
ReferTrack은 단일 전면 카메라 기반의 언어 지시 추적 문제를 해결하기 위해 언급 후 추적 방식을 도입한 VLA 모델로, EVT-Bench에서 최고 성능을 달성한다.
- #3TableVerse: A Large-scale Tabletop Dataset with Real-world Grounded Layouts for Generalizable Manipulation
TableVerse는 10만 개의 실제 기반 테이블탑 환경과 조작 트레젝토리를 포함한 대규모 데이터셋을 생성하는 자동화된 Real2Sim 파이프라인을 제시한다.
- #4FinanceComplexQA: Benchmarking Agentic Reasoning on Industrial-grade Financial Documents
FinanceComplexQA는 1009개의 실제 금융 문서를 기반으로 2,026개의 깊은 연구 질문을 포함한 금융 문서 QA 벤치마크로, Agent-as-a-Judge 평가를 통해 정확도와 추론력을 평가한다.
- #6AREX: Towards a Recursively Self-Improving Agent for Deep Research
AREX는 재귀적 자기 개선을 통해 깊은 연구 성능을 향상시키는 대형 언어 에이전트 시스템이다.
- #7Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment
Anchor-Align는 VLA 미세조정 시 사전 학습된 표현을 보존하고 언어-작동 정렬을 강화하여 실제 로봇 성능을 28%에서 54%까지 향상시킨다.
- #9SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD
Ascend NPU 기반으로 DeepSeek-V4 모델의 트릴리언-파라미터 포스트 트레이닝을 최적화한 SLAI T-Rex 프레임워크를 제시한다.
- #10Multi-Turn On-Policy Distillation with Prefix Replay
ReOPD는 학습 비용을 4배 이상 절감하면서도 정확도를 유지하는 오프라인 멀티턴 온폴리시 디스틸레이션 방법이다.
- #11DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations
DocOps는 문서 조작 능력을 평가하는 검증 가능한 벤치마크 프레임워크이다.
- #12K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs
K12-KGraph는 중국 교과서 기반의 과정 지식 그래프로, 교육용 LLM의 커리큘럼 인지 능력을 평가하고 훈련하는 데 활용된다.
- #13Visual Contrastive Self-Distillation
VCSD는 시각 정보의 조건 변화를 활용한 간단한 온-포로피 시스드(VCSD)로, 외부 티처 없이 모델 성능을 향상시킨다.
- #14Recurrent Sinusoidal INRs for Efficient High-Fidelity Representation
신경망의 파라미터 증가 없이 고주파 정보를 효과적으로 표현하는 반복 사인 활성화 기반 INR 구조를 제안한다.
- #15Subliminal Clocks: Latent Time Modelling in Diffusion Language Models
DLMs가 잔여 스트림 내에서 확산 단계 정보를 내재적으로 인코딩하고 이를 제어할 수 있음을 밝힘.
- #16Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text
ProVisE와 SpatialGen-Bench를 통해 이미지 생성 모델의 시각적 공간 인지 평가가 가능해졌다.
- #17Self Gradient Forcing: Native Long Video Extrapolation
Self Gradient Forcing(SGF)는 자동 회귀 비디오 생성에서 역사적 컨텍스트의 학습을 강화하여 장시간 비디오 외삽을 향상시키는 2단계 훈련 전략이다.
- #18Beyond Relevance-Centric Retrieval: Rubric-Oriented Document Set Selection and Ranking
Rubric4Setwise는 문서 집합의 질을 다차원적으로 평가하고 이를 기반으로 최적의 문서 선택을 수행하여 생성 성능을 향상시키는 훈련 없이 작동하는 시스템이다.
- #19An Exam for Active Observers
ActiveVision 벤치마크를 통해 MLLMs가 활성 시각 관찰 능력을 갖추지 못함을 실증적으로 밝힘.
- #20NVIDIA-labs OO Agents: Native Python Object-Oriented Agents
NVIDIA OO Agents(NOOA)는 AI 에이전트를 Python 객체로 표현하는 모델-비관련 프레임워크로, 개발자와 에이전트가 동일한 인터페이스를 공유하여 테스트 및 개선이 용이하다.
- #21Color Pass-Through via Camera-Display Coupling
스마트폰 카메라와 디스플레이를 통합한 Color Pass-Through 프레임워크를 제안하여 실제 장면의 색감을 정확히 재현한다.
- #22Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction
Tencent WorkBuddy Bench는 코드, 웹, 오피스, 보안 4개 도메인에서 오염에 강한 코딩 에이전트 평가 벤치마크를 제공한다.
- #23LLMs Get Lost in Evolving User Intent
LLMs가 대화 중 사용자의 변화하는 의도를 효과적으로 추적하지 못한다는 문제를 밝혀낸 연구.
- #24SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation
SANA-Video 2.0은 5B 및 14B 규모의 하이브리드 어텐션 비디오 생성 모델로, 720p 영상 생성 시 3.2× 가속된 DiT 성능과 84.30의 VBench 점수를 달성한다.
- #25Scaling Laws for Hypernetwork-Based Knowledge Injection in Large Language Models
하이퍼네트워크 기반 지식 주입이 대규모 언어 모델에서 예측 가능한 스케일링 법칙과 우수한 OOD 일반화를 보인다.
- #26Self-Supervised Learning of Structured Dynamics from Videos
SDM은 동결된 이미지 백본 위에 구축된 구조화된 동영상 역학 모델로, 미래 특징 예측을 통해 카메라 운동과 객체 운동을 분리한다.
- #27Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization
RIPO는 기하학적 불일치를 해결해 LLM RL에서 탐색 붕괴를 극복하고, AIME24에서 GRPO 대비 최대 60% 개선.