HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-09-13 featured 논문 30편

  1. #1DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge

    DreamVLA는 역동적 영역, 깊이, 의미적 정보를 예측하여 로봇 조작 성능을 향상시키는 새로운 VLA 프레임워크이다.

    Wenyao Zhang, Hongsi Liu, Zekun Qi, Yunnan Wang, Xinqiang Yu

  2. #2Real-Time Execution of Action Chunking Flow Policies

    실시간 실행을 위한 RTC 알고리즘으로, 디퓨전/플로우 기반 VLA의 액션 청크 처리를 비동기적으로 수행하여 지연에 강한 성능을 보인다.

    Kevin Black, Manuel Y. Galliker, Sergey Levine

  3. #3Scaling Automatic Research Agents via World Models

    WMRL은 AutoResearch 에이전트의 RL 학습을 3–4× 가속화하면서 성능을 향상시키는 세계 모델 기반 접근법이다.

    Xiyuan Yang, Sheikh Sarwar, Jingru Cheng, Zhan Shi, Duanshun Li

  4. #4A-MEM: Agentic Memory for LLM Agents

    A-MEM은 Zettelkasten 방식을 기반으로 LLM 에이전트의 기억을 동적으로 조직하고 진화시키는 새로운 에이전트형 메모리 시스템이다.

    Wujiang Xu, Zujie Liang, K. Mei, Hang Gao, Juntao Tan

  5. #5VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning

    VL-Rethinker는 강화학습을 활용해 시각-언어 모델의 자기반성 능력을 향상시킨 모델로, MathVista에서 80.4%의 성능을 달성했다.

    Haozhe Wang, Chao Qu, Zuming Huang, Wei Chu, Fangzhen Lin

  6. #6MathArena: Evaluating LLMs on Uncontaminated Math Competitions

    MathArena는 수학 경시 문제를 활용한 LLM 수학 추론 능력 평가 벤치마크로, 오염되지 않은 문제와 증명 작성 평가를 제공한다.

    Mislav Balunovic, Jasper Dekoninck, Ivo Petrov, Nikola Jovanovi'c, Martin T. Vechev

  7. #7An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics

  8. #8MoGe-2: Accurate Monocular Geometry with Metric Scale and Sharp Details

    MoGe-2는 단일 이미지에서 정확한 계량적 3D 점 맵을 생성하는 개방형 도메인 기하 추정 모델이다.

    Ruicheng Wang, Sicheng Xu, Yue Dong, Yu Deng, Jianfeng Xiang

  9. #9AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning

    AutoVLA는 시각-언어-액션 모델을 활용한 단일 자동 생성 모델 기반의 엔드투엔드 자율 주행 프레임워크로, 적응형 추론과 강화 학습을 통해 성능과 효율성을 동시에 향상시킨다.

    Zewei Zhou, Tianhui Cai, Seth Z. Zhao, Yun Zhang, Zhiyu Huang

  10. #10Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning

    Pixel-Reasoner는 시각 정보를 직접 조작하는 픽셀 공간 추론을 강화 학습을 통해 구현한 최초의 VLM이다.

    Alex Su, Haozhe Wang, Weiming Ren, Fangzhen Lin, Wenhu Chen

  11. #11MMaDA: Multimodal Large Diffusion Language Models

    MMaDA는 텍스트 추론, 멀티모달 이해, 텍스트-이미지 생성에서 우수한 성능을 보이는 통합 멀티모달 확산 기반 모델이다.

    Ling Yang, Ye Tian, Bowen Li, Xinchen Zhang, Ke Shen

  12. #12MASt3R-SLAM: Real-Time Dense SLAM with 3D Reconstruction Priors

    MASt3R-SLAM은 3D 재구성 사전 정보를 기반으로 15 FPS 실시간 밀도 SLAM을 구현한 시스템이다.

    Riku Murai, Eric Dexheimer, Andrew J. Davison

  13. #229SpatialBlock: Enhancing Spatial Intelligence in LVLMs via Synthetic Block-Stacking Problem

    SpatialBlock-15k라는 합성 블록 쌓기 데이터셋을 통해 LVLM의 공간 지능을 향상시키는 새로운 학습 패러다임을 제안한다.

    Soohyun Ryu, Sohee Kim, Eunho Yang

  14. #304Mi-Ripple: Restoring Images Degraded by Iterative AI Editing

    Mi-Ripple은 반복적인 AI 이미지 편집으로 생긴 디지털 릴리프를 진단 기반으로 복원하는 워크플로우다.

    Jiayin Chen, Yicheng Xu, Muting Wang

  15. #305NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction

    NCP-ArchPreview는 개념 수준 예측을 도입한 대규모 잠재공간 언어 모델로, 기존 토큰 예측 기반 모델보다 높은 성능을 보인다.

    The Intern-NCP Team, :, Jiaqi Cao, Chiyu Chen, Shuang Cheng

  16. #306SenseNova-U1.5: Towards Native Unified Visual Intelligence

    SenseNova-U1.5는 8B-MoT 아키텍처를 기반으로, 인코더 및 VAE 없이 시각 이해, 추론, 생성을 통합한 4K 해상도까지 지원하는 네이티브 통합 시각 지능 모델이다.

    Haiwen Diao, Jiahao Wang, Chenjing Ding, Hanming Deng, Jiangnan Chen

  17. #307Memory as Plans: World-Action Modeling with Memory-Grounded Planning

    MaP-WAM은 장기 기억 기반 계획과 실행을 분리하여 RMBench에서 83.3% 성공률을 달성한 로봇 제어 프레임워크이다.

    Sizhe Zhao, Haozhe Xie, Weiyu Zhao, Chenchu Zhang, Huan Wang

  18. #308The Price of Sparsity: Sufficient Conditions for Sparse Recovery using Sparse and Sparsified Measurements

    이 연구는 희소 측정 행렬을 사용한 희소 신호의 support recovery에 대한 정보 이론적 한계와 trade-off를 분석한다.

    Youssef Chaabouni, David Gamarnik

  19. #312T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks

    T1은 122B Mixture-of-Experts 모델로, 300+ 툴 호출을 처리하며 강화 학습을 통해 터미널 작업 성능을 64.0%까지 향상시킨다.

    Junyao Yang, Yucheng Shi, Zhongzhi Li, Ruhan Wang, Zongxia Li

  20. #313EvoSafeHarness: Evolving Model- and Domain-Specific Harnesses for Securing Agents

    EvoSafeHarness는 모델과 도메인에 맞춘 안전성 햬스를 진화적으로 생성하여, 기존 정적 햬스 대비 안전성-유틸리티 균형을 개선한다.

    Nanxi Li, Yingzi Ma, Yulong Cao, Edward Suh, Bo Li

  21. #315X-AuT: Progressive Audio-Encoder Compression for Speech LLMs with Cross-Scale Distillation

    X-AuT는 Qwen3-ASR 모델의 오디오 인코더를 점진적으로 압축하면서 정확도를 유지하는 프레임워크로, 14층 모델에서 20.7%의 파라미터 감소와 5.75%의 매크로 오류를 달성한다.

  22. #317FreeFlow: A Bias-free Hierarchical Transformer for Optical Flow Estimation

  23. #318PARSER: Read in Parallel, Reason in Depth for Long-Context LLM Agents

    PARSER는 긴 문서를 병렬로 읽고 추론을 반복적으로 수행하여, 기존 순차 메모리 기반 모델 대비 정확도와 추론 속도를 동시에 개선한 LLM 에이전트 구조이다.

    Kun Li, Zexuan Qiu, Tianhua Zhang, Irwin King, Helen Meng

  24. #319MetroLLM-Bench: Evaluating Language Models as Transit Kiosk Runtimes

  25. #321Studying Image Tokenizers as Visual Languages in Unified Multimodal Models

    이미지 토크나이저가 통합 멀티모달 모델에서 어떻게 텍스트와 상호작용하는지, 손실 기반 실험을 통해 분석한다.

  26. #322TempCloze: Can Video-LLMs Identify the Missing Middle?

    TempCloze는 영상 기반 대형 언어 모델의 시각적 시간 추론 능력을 평가하기 위한 새로운 비디오 클로즈 벤치마크이다.

  27. #323Recursive Code World Models: Building Complex Worlds through Recursive Scene Programs

    RCWM은 단일 이미지에서 재귀적 코드 프로그램을 생성해 복잡한 3D 세계를 재구성하는 새로운 프레임워크이다.

  28. #324World in World: Explore the World with World Models

    World in World(WiW)는 학습 없이 동영상 월드 모델을 다양한 시점에서 제어하는 시각적 증거 인터페이스를 제시한다.

  29. #325Negative Self-Distillation: Learning to Reason by Avoiding Flaws

    NSD는 LLM이 스스로 생성한 오류 추론을 피하도록 훈련하여 수학적 추론 성능을 향상시키는 새로운 자기 부트스트랩 프레임워크이다.

  30. #326HyQuant: Hybrid-Precision Quantization for LLM Attention

    HyQuant는 LLM의 어텐션 모듈을 혼합 정밀도로 양자화하여 정확도와 효율성을 균형 있게 유지하는 프레임워크이다.

인기 키워드

reinforcement-learning (352) diffusion-models (203) llm (199) llm-agents (166) video-generation (138) llm-evaluation (137) transformer (132) vision-language (125) vlm (109) long-context (104) large-language-models (101) code-generation (98) long-horizon (91) benchmark-evaluation (89) benchmarking (86) language-models (81) retrieval-augmented (77) foundation-models (73) flow-matching (72) world-models (72)