HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-10-04 featured 논문 30편

  1. #1Track2Act: Predicting Point Tracks from Internet Videos Enables Generalizable Robot Manipulation

    Homanga Bharadhwaj, Roozbeh Mottaghi, Abhinav Gupta, Shubham Tulsiani

  2. #2ForceVLA: Enhancing VLA Models with a Force-aware MoE for Contact-rich Manipulation

    ForceVLA는 외부 힘을 1등급 모달로 통합한 VLA 모델로, 접촉이 많은 조작 작업 성능을 23.2% 개선한다.

    Jiawen Yu, Hairuo Liu, Qiaojun Yu, Jieji Ren, Ce Hao

  3. #3Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing

    ViLaSR은 시각적 그리기 연산을 통해 LVLM의 공간 추론 능력을 향상시키는 새로운 패러다임을 제안하며, 18.4% 평균 성능 개선을 달성한다.

    Jun Wu, Jian Guan, Kaituo Feng, Qiang Liu, Shuning Wu

  4. #4Benchmarking and Enhancing Skill-Level Memory for Partially Observable Robotic Manipulation

    Yansong Shi, Jiange Yang, Xijie Yang, Shaowei Zhang, Yuhan Zhu

  5. #5InterEvolve: Test-Time Evolution of Reward Programs for Humanoid Loco-Manipulation

    InterEvolve는 학습된 제어기 없이 새로운 로보틱스 작업을 테스트 시점에 진화시켜 수행하는 시스템이다.

    Zhuo Lin, Sirui Xu, Liuyu Bian, Yu-Xiong Wang, Liang-Yan Gui

  6. #6Ego2Act: Evaluating Goal-Directed Manipulation in Egocentric Video Generation

    Patrick Amadeus Irawan, Iskandar Muda Rizky Parlambang, Rava Maulana, Qinrong Cui, Erland Hilman Fuadi

  7. #7Remasking Discrete Diffusion Models with Inference-Time Scaling

    ReMDM은 마스킹 기반 이산 확산 모델에 재마스킹 기능을 추가하여 추론 시 계산량 조절과 샘플 품질 향상을 실현한 새로운 샘플러이다.

    Guanghan Wang, Yair Schiff, S. Sahoo, V. Kuleshov

  8. #8Autoregressive Queries for Adaptive Tracking with Spatio-Temporal Transformers

    Jinxia Xie, Bineng Zhong, Zhiyi Mo, Shengping Zhang, Liangtao Shi

  9. #9MLLMs Know Where to Look: Training-free Perception of Small Visual Details with Multimodal LLMs

    MLLMs는 작은 시각 세부사항을 인식하는 데 어려움을 겪으며, 이를 주의력 맵과 그래디언트를 활용한 무학습 시각 조작으로 개선할 수 있다.

    Jiarui Zhang, Mahyar Khayatkhoei, P. Chhikara, Filip Ilievski

  10. #10Multi-SWE-bench: A Multilingual Benchmark for Issue Resolving

    Daoguang Zan, Zhirong Huang, Wei Liu, Hanwu Chen, Linhao Zhang

  11. #11Faithful Logical Reasoning via Symbolic Chain-of-Thought

    Jundong Xu, Hao Fei, Liangming Pan, Qian Liu, Mong Li Lee

  12. #12DF40: Toward Next-Generation Deepfake Detection

    DF40은 40가지 딥페이크 기법을 포함한 다목적 벤치마크 데이터셋으로, 기존 한계를 극복한 차세대 딥페이크 탐지 연구를 촉진한다.

    Zhiyuan Yan, Taiping Yao, Shen Chen, Yandan Zhao, Xinghe Fu

  13. #13WebDancer: Towards Autonomous Information Seeking Agency

    Jialong Wu, Baixuan Li, Runnan Fang, Wenbiao Yin, Liwen Zhang

  14. #287RLE-Bench: A Qualifying Exam for Coding Agents as Robot Learning Engineers

    RLE-Bench는 로봇 공학 엔지니어 역할을 수행하는 코드 생성 에이전트를 평가하는 벤치마크로, 4개의 핵심 워크플로우를 기준으로 종합적인 능력을 측정한다.

    Haitong Ma, Chenxiao Gao, Rushi Qiang, Bo Dai, Na Li

  15. #305OneStreamer: Unifying Perception, Memory, and Proactive Response in Streaming Video Interaction

    OneStreamer는 스트리밍 영상에서 지속적 인식과 기억 형성을 통합한 4B 파라미터 모델로, PHCM과 PSTL을 통해 실시간 대응 성능을 향상시킨다.

    Xiangyu Zeng, Yuandong Yang, Zhiqiu Zhang, Yuhan Zhu, Xinhao Li

  16. #306X-Tree: Tokenizing Reusable Experience for Efficient Agent Generalization

    X-Tree는 토크나이저 방식을 따라 경험을 재사용 가능한 계층 구조로 변환하여, 4.5% SR 개선을 포함한 효율적인 에이전트 학습을 가능하게 한다.

    Sitao Cheng, Xunjian Yin, Zhiyuan Sun, Yuxuan Li, Ruiwen Zhou

  17. #307On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics

    Julianna Piskorz, Antonin Berthon, Mihaela van der Schaar

  18. #308Transformers Stop Thinking Too Early, and a Tiny LoRA Fixes It

    Zehao Jin, Ruixuan Deng, Junran Wang

  19. #309LOCI: Spatial Linear Memory for Streaming World Models

    Ji Xia, Tingting Liao, Xuezhi Liang, Hao Li, Guangyi Liu

  20. #310E-MoE: Enhanced Mixture-of-Experts for Non-Factorized Diffusion Language Models

    Arseny Ivanov, Alexander Kolesov, Alexander Korotin, Ivan Oseledets, Mikhail Goncharov

  21. #311Devils in Question Relay: Source-Conditioned Relay Steering to Mitigate Hallucinations in Audio-visual Large Language Models

    Yu Zhang, Pingrui Zhang, Xuefeng Bai, Pengfei Zhang, Yang Xiang

  22. #312Make Sparse Rewards Count: Density-Aware Reward Aggregation for Multi-Reward RL

    Tong Zheng, Skylar Zhai, Zhan Cheng, TianMing Sha, Youling Huang

  23. #313OTRetarget: Joint Robot and Object Motion Retargeting via Optimal Transport

    Guillaume Besset, Erwann Carn, Timothée Carecchio, Valentin Tordjman-Levavasseur, Fabian Schramm

  24. #314Video Generation Models: A Survey of Post-Training and Alignment

    Chaoyu Li, Xiaoyi Gu, Yogesh Kulkarni, Eun Woo Im, Mohammadmahdi Honarmand

  25. #315EgoTools: Towards Tool-Centric Reasoning in Real-World Egocentric Videos

    Shulin Tian, Junsu Kim, Shuai Liu, Hao Li, Yujiao Shen

  26. #316Persona Dosing: Calibrated Activation Steering for Graded Trait Control

    Zehao Jin, Junran Wang, Ruixuan Deng, Jiahao Chen, Jingyuan Zhang

  27. #317Decentralized Master-Mind: Joint Action Refinement through Iterative Intent Denoising in Multi-Agent Pathfinding

    Valeriy Vyaltsev, Anton Andreychuk, Taisia Zlotnikova, Konstantin Yakovlev, Aleksandr Panov

  28. #318Fewer Tokens, Better Action: GPT-6 Astra Robot Agents with 14% Higher Success Rate but 65% Fewer Tokens

    Ruiyang Si, Jianxin Bi, Shunyu Yang, Rui Ni, Wenbo Huang

  29. #319Honeycomb: Constant-Size Scene Memory Representation for Video World Models

    Jack Wei Lun Shi, Kaichen Zhou, Haoyu Chen, Yufeng Weng, Keane Ong

  30. #320SILSA: Sliding-Window Slice Latents for Topology-Preserving High-Resolution 3D Generation

    Tianjiao Yu, Xinzhuo Li, Yifan Shen, Ying Shen, Kiet A. Nguyen

인기 키워드

reinforcement-learning (402) diffusion-models (228) llm (219) llm-agents (181) video-generation (159) llm-evaluation (154) transformer (149) vision-language (149) large-language-models (126) long-context (119) vlm (110) code-generation (107) language-models (102) benchmark-evaluation (101) long-horizon (100) benchmarking (97) foundation-models (82) retrieval-augmented (81) world-models (78) chain-of-thought (77)