- #1DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge
DreamVLA는 역동적 영역, 깊이, 의미적 정보를 예측하여 로봇 조작 성능을 향상시키는 새로운 VLA 프레임워크이다.
- #2Real-Time Execution of Action Chunking Flow Policies
실시간 실행을 위한 RTC 알고리즘으로, 디퓨전/플로우 기반 VLA의 액션 청크 처리를 비동기적으로 수행하여 지연에 강한 성능을 보인다.
- #3Scaling Automatic Research Agents via World Models
WMRL은 AutoResearch 에이전트의 RL 학습을 3–4× 가속화하면서 성능을 향상시키는 세계 모델 기반 접근법이다.
- #4A-MEM: Agentic Memory for LLM Agents
A-MEM은 Zettelkasten 방식을 기반으로 LLM 에이전트의 기억을 동적으로 조직하고 진화시키는 새로운 에이전트형 메모리 시스템이다.
- #5VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning
VL-Rethinker는 강화학습을 활용해 시각-언어 모델의 자기반성 능력을 향상시킨 모델로, MathVista에서 80.4%의 성능을 달성했다.
- #6MathArena: Evaluating LLMs on Uncontaminated Math Competitions
MathArena는 수학 경시 문제를 활용한 LLM 수학 추론 능력 평가 벤치마크로, 오염되지 않은 문제와 증명 작성 평가를 제공한다.
- #7An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics
- #8MoGe-2: Accurate Monocular Geometry with Metric Scale and Sharp Details
MoGe-2는 단일 이미지에서 정확한 계량적 3D 점 맵을 생성하는 개방형 도메인 기하 추정 모델이다.
- #9AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning
AutoVLA는 시각-언어-액션 모델을 활용한 단일 자동 생성 모델 기반의 엔드투엔드 자율 주행 프레임워크로, 적응형 추론과 강화 학습을 통해 성능과 효율성을 동시에 향상시킨다.
- #10Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning
Pixel-Reasoner는 시각 정보를 직접 조작하는 픽셀 공간 추론을 강화 학습을 통해 구현한 최초의 VLM이다.
- #11MMaDA: Multimodal Large Diffusion Language Models
MMaDA는 텍스트 추론, 멀티모달 이해, 텍스트-이미지 생성에서 우수한 성능을 보이는 통합 멀티모달 확산 기반 모델이다.
- #12MASt3R-SLAM: Real-Time Dense SLAM with 3D Reconstruction Priors
MASt3R-SLAM은 3D 재구성 사전 정보를 기반으로 15 FPS 실시간 밀도 SLAM을 구현한 시스템이다.
- #229SpatialBlock: Enhancing Spatial Intelligence in LVLMs via Synthetic Block-Stacking Problem
SpatialBlock-15k라는 합성 블록 쌓기 데이터셋을 통해 LVLM의 공간 지능을 향상시키는 새로운 학습 패러다임을 제안한다.
- #304Mi-Ripple: Restoring Images Degraded by Iterative AI Editing
Mi-Ripple은 반복적인 AI 이미지 편집으로 생긴 디지털 릴리프를 진단 기반으로 복원하는 워크플로우다.
- #305NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction
NCP-ArchPreview는 개념 수준 예측을 도입한 대규모 잠재공간 언어 모델로, 기존 토큰 예측 기반 모델보다 높은 성능을 보인다.
- #306SenseNova-U1.5: Towards Native Unified Visual Intelligence
SenseNova-U1.5는 8B-MoT 아키텍처를 기반으로, 인코더 및 VAE 없이 시각 이해, 추론, 생성을 통합한 4K 해상도까지 지원하는 네이티브 통합 시각 지능 모델이다.
- #307Memory as Plans: World-Action Modeling with Memory-Grounded Planning
MaP-WAM은 장기 기억 기반 계획과 실행을 분리하여 RMBench에서 83.3% 성공률을 달성한 로봇 제어 프레임워크이다.
- #308The Price of Sparsity: Sufficient Conditions for Sparse Recovery using Sparse and Sparsified Measurements
이 연구는 희소 측정 행렬을 사용한 희소 신호의 support recovery에 대한 정보 이론적 한계와 trade-off를 분석한다.
- #312T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks
T1은 122B Mixture-of-Experts 모델로, 300+ 툴 호출을 처리하며 강화 학습을 통해 터미널 작업 성능을 64.0%까지 향상시킨다.
- #313EvoSafeHarness: Evolving Model- and Domain-Specific Harnesses for Securing Agents
EvoSafeHarness는 모델과 도메인에 맞춘 안전성 햬스를 진화적으로 생성하여, 기존 정적 햬스 대비 안전성-유틸리티 균형을 개선한다.
- #315X-AuT: Progressive Audio-Encoder Compression for Speech LLMs with Cross-Scale Distillation
X-AuT는 Qwen3-ASR 모델의 오디오 인코더를 점진적으로 압축하면서 정확도를 유지하는 프레임워크로, 14층 모델에서 20.7%의 파라미터 감소와 5.75%의 매크로 오류를 달성한다.
- #317FreeFlow: A Bias-free Hierarchical Transformer for Optical Flow Estimation
- #318PARSER: Read in Parallel, Reason in Depth for Long-Context LLM Agents
PARSER는 긴 문서를 병렬로 읽고 추론을 반복적으로 수행하여, 기존 순차 메모리 기반 모델 대비 정확도와 추론 속도를 동시에 개선한 LLM 에이전트 구조이다.
- #319MetroLLM-Bench: Evaluating Language Models as Transit Kiosk Runtimes
- #321Studying Image Tokenizers as Visual Languages in Unified Multimodal Models
이미지 토크나이저가 통합 멀티모달 모델에서 어떻게 텍스트와 상호작용하는지, 손실 기반 실험을 통해 분석한다.
- #322TempCloze: Can Video-LLMs Identify the Missing Middle?
TempCloze는 영상 기반 대형 언어 모델의 시각적 시간 추론 능력을 평가하기 위한 새로운 비디오 클로즈 벤치마크이다.
- #323Recursive Code World Models: Building Complex Worlds through Recursive Scene Programs
RCWM은 단일 이미지에서 재귀적 코드 프로그램을 생성해 복잡한 3D 세계를 재구성하는 새로운 프레임워크이다.
- #324World in World: Explore the World with World Models
World in World(WiW)는 학습 없이 동영상 월드 모델을 다양한 시점에서 제어하는 시각적 증거 인터페이스를 제시한다.
- #325Negative Self-Distillation: Learning to Reason by Avoiding Flaws
NSD는 LLM이 스스로 생성한 오류 추론을 피하도록 훈련하여 수학적 추론 성능을 향상시키는 새로운 자기 부트스트랩 프레임워크이다.
- #326HyQuant: Hybrid-Precision Quantization for LLM Attention
HyQuant는 LLM의 어텐션 모듈을 혼합 정밀도로 양자화하여 정확도와 효율성을 균형 있게 유지하는 프레임워크이다.