- #1Track2Act: Predicting Point Tracks from Internet Videos Enables Generalizable Robot Manipulation
- #2ForceVLA: Enhancing VLA Models with a Force-aware MoE for Contact-rich Manipulation
ForceVLA는 외부 힘을 1등급 모달로 통합한 VLA 모델로, 접촉이 많은 조작 작업 성능을 23.2% 개선한다.
- #3Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
ViLaSR은 시각적 그리기 연산을 통해 LVLM의 공간 추론 능력을 향상시키는 새로운 패러다임을 제안하며, 18.4% 평균 성능 개선을 달성한다.
- #4Benchmarking and Enhancing Skill-Level Memory for Partially Observable Robotic Manipulation
- #5InterEvolve: Test-Time Evolution of Reward Programs for Humanoid Loco-Manipulation
InterEvolve는 학습된 제어기 없이 새로운 로보틱스 작업을 테스트 시점에 진화시켜 수행하는 시스템이다.
- #6Ego2Act: Evaluating Goal-Directed Manipulation in Egocentric Video Generation
- #7Remasking Discrete Diffusion Models with Inference-Time Scaling
ReMDM은 마스킹 기반 이산 확산 모델에 재마스킹 기능을 추가하여 추론 시 계산량 조절과 샘플 품질 향상을 실현한 새로운 샘플러이다.
- #8Autoregressive Queries for Adaptive Tracking with Spatio-Temporal Transformers
- #9MLLMs Know Where to Look: Training-free Perception of Small Visual Details with Multimodal LLMs
MLLMs는 작은 시각 세부사항을 인식하는 데 어려움을 겪으며, 이를 주의력 맵과 그래디언트를 활용한 무학습 시각 조작으로 개선할 수 있다.
- #10Multi-SWE-bench: A Multilingual Benchmark for Issue Resolving
- #11Faithful Logical Reasoning via Symbolic Chain-of-Thought
- #12DF40: Toward Next-Generation Deepfake Detection
DF40은 40가지 딥페이크 기법을 포함한 다목적 벤치마크 데이터셋으로, 기존 한계를 극복한 차세대 딥페이크 탐지 연구를 촉진한다.
- #13WebDancer: Towards Autonomous Information Seeking Agency
- #287RLE-Bench: A Qualifying Exam for Coding Agents as Robot Learning Engineers
RLE-Bench는 로봇 공학 엔지니어 역할을 수행하는 코드 생성 에이전트를 평가하는 벤치마크로, 4개의 핵심 워크플로우를 기준으로 종합적인 능력을 측정한다.
- #305OneStreamer: Unifying Perception, Memory, and Proactive Response in Streaming Video Interaction
OneStreamer는 스트리밍 영상에서 지속적 인식과 기억 형성을 통합한 4B 파라미터 모델로, PHCM과 PSTL을 통해 실시간 대응 성능을 향상시킨다.
- #306X-Tree: Tokenizing Reusable Experience for Efficient Agent Generalization
X-Tree는 토크나이저 방식을 따라 경험을 재사용 가능한 계층 구조로 변환하여, 4.5% SR 개선을 포함한 효율적인 에이전트 학습을 가능하게 한다.
- #307On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics
- #308Transformers Stop Thinking Too Early, and a Tiny LoRA Fixes It
- #309LOCI: Spatial Linear Memory for Streaming World Models
- #310E-MoE: Enhanced Mixture-of-Experts for Non-Factorized Diffusion Language Models
- #311Devils in Question Relay: Source-Conditioned Relay Steering to Mitigate Hallucinations in Audio-visual Large Language Models
- #312Make Sparse Rewards Count: Density-Aware Reward Aggregation for Multi-Reward RL
- #313OTRetarget: Joint Robot and Object Motion Retargeting via Optimal Transport
- #314Video Generation Models: A Survey of Post-Training and Alignment
- #315EgoTools: Towards Tool-Centric Reasoning in Real-World Egocentric Videos
- #316Persona Dosing: Calibrated Activation Steering for Graded Trait Control
- #317Decentralized Master-Mind: Joint Action Refinement through Iterative Intent Denoising in Multi-Agent Pathfinding
- #318Fewer Tokens, Better Action: GPT-6 Astra Robot Agents with 14% Higher Success Rate but 65% Fewer Tokens
- #319Honeycomb: Constant-Size Scene Memory Representation for Video World Models
- #320SILSA: Sliding-Window Slice Latents for Topology-Preserving High-Resolution 3D Generation