HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-09-10 featured 논문 30편

  1. #1CosmoH2G: A Hand-to-Gripper Transfer Dataset and Baseline Method for Object Manipulation with Complex Spatial Movements

    Hongxiang Zhao, Mutian Xu, Zeyu Jin, Yiming Hao, Shuguang Cui

  2. #2Large Language Models to Enhance Bayesian Optimization

    LLAMBO는 대형 언어 모델을 활용해 베이지안 최적화 성능을 향상시키는 모듈식 접근법이다.

    Tennison Liu, N. Astorga, Nabeel Seedat, M. Schaar

  3. #3RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

    RL-VLM-F는 VLM 피드백을 활용해 텍스트와 시각 관측만으로 강화 학습 보상을 자동 생성하는 방법이다.

    Yufei Wang, Zhanyi Sun, Jesse Zhang, Zhou Xian, Erdem Biyik

  4. #4GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation

    GE-Act 2.0은 조작 데이터에서 처음부터 학습된 월드-액션 모델로, 30,000시간 데이터로 44.1% 성공률을 달성하며 OOD 성능과 행동 다양성 향상에 기여한다.

    AgiBot Research Team, Renhang Liu, Wenzhi Zhao, Zhuo Yang, Liliang Chen

  5. #5LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models

    LLaDA 1.5는 ELBO 기반의 Variance-Reduced Preference Optimization(VRPO)를 통해 수학, 코드, 정렬 작업에서 기존 모델 대비 1~4.7% 성능 향상.

    Fengqi Zhu, Rongzheng Wang, Shen Nie, Xiaolu Zhang, Chunwei Wu

  6. #6Demystify Mamba in Vision: A Linear Attention Perspective

    Mamba는 선형 어텐션 트랜스포머와 유사한 구조를 가지며, 잊기 게이트와 블록 설계가 성능 향상에 핵심 역할을 한다.

    Dongchen Han, Ziyi Wang, Zhuofan Xia, Yizeng Han, Yifan Pu

  7. #7MapCoder: Multi-Agent Code Generation for Competitive Problem Solving

    MapCoder는 인간 개발자와 유사한 4단계 프로세스를 모방한 멀티에이전트 프롬프팅을 통해 코드 생성 성능을 대폭 향상시킨다.

    Md. Ashraful Islam, Mohammed Eunus Ali, Md. Rizwan Parvez

  8. #8Street Gaussians: Modeling Dynamic Urban Scenes with Gaussian Splatting

    Street Gaussians는 3D 가우시안 포인트 클라우드를 기반으로 도시 거리 장면을 실시간 렌더링하는 새로운 표현 방식이다.

    Yunzhi Yan, Haotong Lin, Chenxu Zhou, Weijie Wang, Haiyang Sun

  9. #9VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos

    VideoTree는 장시간 동영상의 LLM 추론을 위한 트리 기반의 적응적 표현 방식으로, EgoSchema에서 61.1%의 정확도를 달성한다.

    Ziyang Wang, Shoubin Yu, Elias Stengel-Eskin, Jaehong Yoon, Feng Cheng

  10. #10Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities

    Audio Flamingo는 오디오 이해, 인-컨텍스트 학습, 다중 턴 대화 능력을 갖춘 새로운 오디오 언어 모델로, 다양한 벤치마크에서 최신 기록을 달성한다.

    Zhifeng Kong, Arushi Goel, Rohan Badlani, Wei Ping, Rafael Valle

  11. #11Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs

    RPG는 MLLM을 활용한 텍스트-이미지 생성/편집 프레임워크로, 복합적 텍스트 프롬프트 처리 능력을 향상시킨다.

    Ling Yang, Zhaochen Yu, Chenlin Meng, Minkai Xu, S. Ermon

  12. #12Diffusion Models Are Real-Time Game Engines

    GameNGen은 DOOM 게임을 기반으로 TPU에서 20fps로 실시간 실행 가능한 신경망 기반 게임 엔진으로, 확장 가능한 시뮬레이션과 높은 시각 품질을 제공한다.

    Dani Valevski, Yaniv Leviathan, Moab Arar, Shlomi Fruchter

  13. #292SimpleMemVLA: A Simple but Effective Native-Video Memory for Vision-Language-Action Models

    Cheng Yin, Wang Xu, Junpeng Yang, Sikyuen Tam, Hanyu Liu

  14. #302NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness

    NeoHorse Team, Guoliang Cao, Guohao Dai, Tianyu Guo, Kai Han

  15. #305OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining

    OpenWAM은 모듈화된 연구 스택을 통해 시스템적인 월드-액션 모델 사전학습을 구현한 오픈 프레임워크이다.

    Yuran Wang, Siqiao Huang, Mingleyang Li, Chenhao Zhang, Jiaqi Liang

  16. #306Miles v0.1: Production-Level Post-Training

    RadixArk, :, Tom Chen, Mao Cheng, Shi Dong

  17. #307SceneMosaic: Efficient and Diverse Simulation-Ready Scene Generation via Hybrid Agentic Layout Evolution

    SceneMosaic는 이미지 기반 초기화와 VLM 에이전트를 통한 진화적 레이아웃 조정을 결합하여, 효율적이고 다양한 시뮬레이션 준비 3D 장면을 생성하는 하이브리드 프레임워크이다.

    Xingjian Ran, Xiaoye Mo, Sihao Liu, Jianyu Zhang, Li Luo

  18. #308AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing

    AuK은 자연어와 오디오 컨텍스트를 통합한 인터페이스로 음성 생성 및 편집을 수행하는 오픈소스 기반 모델로, 4.5× 가속된 추론과 3.03억 개의 지시-오디오 인스턴스로 학습된다.

    Ziyang Ma, Zhikang Niu, Wenming Tu, Tianrui Wang, Ruiqi Yan

  19. #309Kalman Delta Networks: Uncertainty-aware Associative Memory

    KDN은 불확실성을 추적하는 Kalman 필터 기반의 새로운 연관 기억 모델로, 기존 DeltaNet 대비 성능을 개선한다.

    Ngoc Bui, Tinglin Huang, Rex Ying

  20. #310Unlocking Lossless Speedups in LLMs via Discrete Diffusion

    Uno는 확률 확산을 활용해 대형 언어 모델의 속도를 3배까지 향상시키는 새로운 구조를 제시한다.

    Subham Sekhar Sahoo, Lingjie Chen, Khiem Pham, Jonathan Geuter, Chaitanya Dwivedi

  21. #311RoboSPA: Can VLA Models Go Beyond Simple Scenes and Short-Horizon Tasks?

    RoboSPA는 VLA 모델의 공간적·절차적 추론 능력을 평가하기 위한 대규모 로봇 조작 벤치마크이다.

    Zhenxuan Fan, Bo Zhang, Yutong Lin, Yuqian Yuan, Juekai Lin

  22. #312Measuring Language Transfer in Robot Policies: Adding Greek to a Cosmos3 Vision-Language-Action Policy

    로봇 정책에 그리스어를 추가할 때, 번역된 데이터만 사용해도 성능이 일부 개선되지만, 정확한 측정이 핵심 과제임을 밝혔다.

    Ayoub Kirouane, Georgios Giaples, Christos Petrocheilos

  23. #313TransNormal-2: Geometry-Grounded Rectified Flow with Edge-Aware Decoding for Precise Normal Estimation

    TransNormal-2는 VAE 재구성 오류를 해결한 정밀 법선 추정 모델로, ClearGrasp에서 4.2°의 MAE 감소를 달성.

    Mingwei Li, Yi Yang, Hehe Fan

  24. #314Omni Interaction Agent Technical Report

    Orantqing, Shengpeng Ji, Junlong Tong, Jialong Zuo, Dongjie Fu

  25. #315ReactVAU: A Slow-Fast Decoupled Framework for Streaming Video Anomaly Understanding

    ReactVAU는 실시간 스트리밍 환경에서 비정상 행동을 감지하고 원인을 설명하는 Slow-Fast 분리 프레임워크이다.

    Chia-Hui Chen, Shih-Ying Yeh, Fu-En Yang, Min-Hung Chen, Shang-Hong Lai

  26. #316Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation

    Youngrok Park, Sangmin Bae, Hojung Jung, Jongwoo Ko, Yunseon Choi

  27. #317DriveZero: End-to-End Driving Beyond Human Demonstrations

    Hao He, Chengcheng Hu, Zirun Su, Heng Zhang, Haisong Liu

  28. #318Mask Forcing: Improving Autoregressive Video Diffusion Distillation via Dual-Noise Masking Rollout

    Zhuoran Zhao, Shengju Qian, Tongtong Liang, Xianghao Kong, Songchun Zhang

  29. #319Marigold V2: Revisiting Diffusion Transformers for Monocular Depth Estimation

    Marigold V2는 Qwen-Image-Edit를 기반으로 2단계 학습 프로토콜을 통해 단일 이미지에서 고해상도 깊이 맵을 생성하는 확산 변형기 기반 모델로, KITTI와 ETH3D에서 AbsRel 기준 16-26% 개선된 성능을 보인다.

    Igor Pavlovic, Thiemo Wandel, Anton Obukhov, Luca Bartolomei, Andrey Davydov

  30. #320ENEAS: Embedding-guided Neural Ensemble for Adaptive Segmentation

    ENEAS는 텍스트 프롬프트 기반의 인스턴스 추적과 의미적 탐지 문제를 해결하기 위한 신경망 앙상블 모델이다.

    Javier del Pino, Salvador Rodríguez, Alejandro Garabito, Javier Álvarez, Chema Garabito

인기 키워드

reinforcement-learning (341) diffusion-models (199) llm (195) llm-agents (163) llm-evaluation (133) video-generation (133) transformer (130) vision-language (121) vlm (109) long-context (103) large-language-models (99) code-generation (94) long-horizon (89) benchmark-evaluation (85) benchmarking (84) language-models (77) retrieval-augmented (77) flow-matching (70) world-models (69) foundation-models (68)