HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-07-31 featured 논문 30편

  1. #1HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone

    HiFi-UMI는 3mm 정밀도의 무로봇 조작 데이터를 생성해, 무로봇 데이터만으로 실제 로봇에 직접 배포 가능한 정책 학습을 실현한다.

    Simple AI, :, Yuteng Wei, Jinming Ma, Jiawei Wang

  2. #2VMamba: Visual State Space Model

    VMamba는 2D 선택적 스캔과 크로스-스캔 모듈을 결합한 시각 상태 공간 모델로, 높은 성능과 선형 복잡도를 동시에 달성한다.

    Yue Liu, Yunjie Tian, Yuzhong Zhao, Hongtian Yu, Lingxi Xie

  3. #3AlphaFold Meets Flow Matching for Generating Protein Ensembles

    AlphaFlow와 ESMFlow는 PDB 및 MD 앙상블 데이터를 기반으로 단백질 구조 다양성을 생성하는 flow matching 기반 생성 모델이다.

    Bowen Jing, Bonnie Berger, T. Jaakkola

  4. #4DAPO: An Open-Source LLM Reinforcement Learning System at Scale

    DAPO는 AIME 2024에서 50점 달성한 Qwen2.5-32B 기반의 대규모 LLM 강화 학습 시스템이다.

    Qiying Yu, Zheng Zhang, Ruofei Zhu, Yufeng Yuan, Xiaochen Zuo

  5. #5CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer

    CogVideoX는 16fps, 768×1360 해상도로 10초 길이의 텍스트-비디오를 생성하는 확장형 디퓨전 트랜스포머 모델이다.

    Zhuoyi Yang, Jiayan Teng, Wendi Zheng, Ming Ding, Shiyu Huang

  6. #6Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data

    Depth Anything는 62M 개의 자동 라벨링된 비정제 이미지를 기반으로 강력한 제로샷 단일 카메라 깊이 추정 모델을 구축한 연구이다.

    Lihe Yang, Bingyi Kang, Zilong Huang, Xiaogang Xu, Jiashi Feng

  7. #7YOLOv12: Attention-Centric Real-Time Object Detectors

    YOLOv12는 주목 메커니즘 기반의 실시간 객체 탐지 모델로, YOLOv10-N 대비 2.1% mAP 향상과 1.64 ms의 빠른 추론 속도를 달성한다.

    Yunjie Tian, Qixiang Ye, David S. Doermann

  8. #8Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model

    Vision Mamba(Vim)는 양방향 SSM과 위치 임베딩을 결합한 시각적 표현 학습 모델로, DeiT 대비 2.8× 빠르고 86.8% GPU 메모리 절약.

    Lianghui Zhu, Bencheng Liao, Qian Zhang, Xinlong Wang, Wenyu Liu

  9. #9Depth Anything V2

    Depth Anything V2는 합성 이미지와 대규모 의사 라벨을 활용해 단일 카메라 깊이 추정 모델의 성능과 효율성을 획기적으로 향상시킨다.

    Lihe Yang, Bingyi Kang, Zilong Huang, Zhen Zhao, Xiaogang Xu

  10. #10MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark

    MMLU-Pro는 기존 MMLU 대비 16~33% 낮은 정확도를 기록하며, 추론 능력을 더 잘 평가하는 다분야 언어이해 벤치마크이다.

    Yubo Wang, Xueguang Ma, Ge Zhang, Yuansheng Ni, Abhranil Chandra

  11. #11KAN: Kolmogorov-Arnold Networks

    KAN은 MLP 대신 가중치에 스플라인 함수를 사용해 정확도와 해석성을 동시에 향상시킨 신경망 구조이다.

    Ziming Liu, Yixuan Wang, Sachin Vaidya, Fabian Ruehle, James Halverson

  12. #27EvoPINN: Agentic Discovery of Executable Algorithms for Physics-Informed Neural Networks

    EvoPINN은 LLM 기반 에이전트를 활용해 PDE 특화 학습 알고리즘을 자동으로 발견하는 실행 기반 프레임워크로, SLRC-PINN 아키텍처를 독자적으로 개발해 기존 방법 대비 L2 오차를 감소시킨다.

    Peng Yin, Kai Li, Yifan Zhang, Jian Cheng

  13. #275TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

    TurboVLA는 RTX 4090에서 32Hz, 0.9GB VRAM으로 97.7% 성공률을 달성한 실시간 VLA 모델이다.

    Hengyi Xie, Chenfei Yao, Xianjin Wu, Xuanyang Xi, Yiping Tang

  14. #299Wonder: Video World Model Done Better

    Wonder는 16 FPS로 분 단위 동영상 생성이 가능한 실시간 카메라 제어형 비디오 월드 모델이다.

    Jiacong Xu, Hanwen Jiang, Zhixin Shu, Kalyan Sunkavalli, Vishal M. Patel

  15. #305CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition

    CLBench-V는 다중 모달 컨텍스트 학습을 평가하기 위한 벤치마크로, 3,443개 인스턴스에서 최고 점수 0.2847를 기록하며 모델의 한계를 드러낸다.

    Lai Wei, Chengqi Li, Jiapeng Li, Ruina Hu, Yue Wang

  16. #306Temporal-Distance JEPA: Plan-Aware Representation Learning for Latent World Model Predictive Control

    TD-JEPA는 오프라인 로그에서 시간적 진행 구조를 추출해 JEPA 월드 모델의 제어 성능을 향상시키는 계획 인식 학습 방법이다.

    Jiaxin Bai, Jiaxuan Xiong

  17. #307A New Role for Relevance: Guiding Corpus Interaction in Agentic Search

    RARG는 문서 레벨의 관련성을 grep 탐색 순서와 매칭 정보 필터링에 활용해 검색 수렴을 가속화하는 에이전트다.

    Jiangnan Li, Yuqing Li, Mo Yu, Jinchao Zhang, Jie Zhou

  18. #308CodeNib: A Multi-View Data System for Serving Repository Context to Coding Agents

    CodeNib은 레포지토리 컨텍스트를 다중 뷰로 재사용하고 효율적으로 제공하는 데이터 시스템이다.

    Zhongming Yu, Hengjia Yu, Boqin Yuan, Shuting Zhao, Yizhao Chen

  19. #309StatePlay: State-Aware Game World Models for Mechanics-Consistent Generation

    StatePlay는 게임 내부 상태를 예측하여 기계적 일관성을 유지하는 첫 번째 상태 인식 게임 월드 모델이다.

    Zijun Lin, Zeqing Wang, Cheston Tan, Bihan Wen, Yeying Jin

  20. #310CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization

    CoRT는 토큰 수준의 크레딧 할당을 위해 카운터패클 레플레이를 활용한 GRPO 개선 방법으로, 평균 4.4%포인트 성능 향상을 보인다.

    Bo-Wen Zhang, Junwei He, Wen Wang, Song-Lin Lv, Wentao Ma

  21. #311HumanCLAW: Can Vision-Language Models Act Through a Body?

    HumanCLAW는 VLM이 신체를 통해 행동하는 능력을 평가하는 프레임워크로, 16.8%의 성공률을 기록하며 현재 VLM이 신체 인식 부족으로 실패함을 밝힘.

    Siyao Li, Jiawei Gu, Shuai Liu, Kairui Hu, Zekun Li

  22. #312Voice Memory for Agentic Speech Recognition

    Voice Memory는 추론 단계에서만 작동하는, 가시적이고 이동 가능한 음성 인식 정책을 구현하는 인프라-제로 인퍼런스 기반의 에이전트 음성 인식 시스템이다.

    Chao-Han Huck Yang, Zih-Ching Chen, Piotr Zelasko, Zhehuai Chen, Jagadeesh Balam

  23. #313ReDesign: Recovering Editable Design Structures from Images via Agentic Decomposition

    ReDesign은 레이아웃, 색상, 텍스트 편집에서 편집 가능성 향상에 성공한 에이전트 기반 편집 가능한 디자인 복원 프레임워크이다.

    Jooyeol Yun, Jintae Park, Hyesu Lim, Junha Hyung, Hyungjin Chung

  24. #314Large-Scale ChatBot Validation Through Customer Digital Twin Simulations

    고품질 디지털 트윈 기반 고객 시뮬레이션으로 은행용 챗봇의 대규모 검증이 가능해진다.

    Cristovao Iglesias, Devesh Batra, Alankar Atreya, Stefan Wagner, Robert Hankache

  25. #315Registration-Grounded Spectral Fusion for Unregistered WLI/NBI Endoscopic Lesion Segmentation

    미등록 WLI/NBI 내시경 이미지를 신뢰도 기반 복소 스펙트럼 융합으로 정확한 병변 분할하는 프레임워크 제안.

    Pengyu Jie, Wanquan Liu, Rui He, Pengcheng Li, Weiping Wen

  26. #316DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text Space

    DecoEvo는 텍스트 공간 최적화를 통해 LLM의 솔버와 루브릭 생성기를 점수와 독립적으로 공진화시켜 평가 성능을 향상시킨다.

    Jiangwang Chen, Zixin Song, Junlin Liu, Shuaiyu Zhou, Haiyan Wu

  27. #317Explicit Layer Modeling for Video Object Insertion and Layer Decomposition

    TriLayer 데이터셋과 DBL-Diffusion을 기반으로 영상의 레이어 구조를 명시적으로 모델링하여 객체 삽입과 분해 성능을 향상시킨다.

    Kyujin Han, Seungjoo Shin, Sunghyun Cho

  28. #318Pass the Baton: Trajectory-Relayed On-Policy Distillation

    Relay-OPD는 학생 모델의 오류 경로를 감지해 교사 모델이 국지적 개입을 수행함으로써, 전방위 학습 효율성을 향상시키는 새로운 온-정책 디스틸레이션 방법이다.

    Haolei Xu, Xiaowen Xu, Haiwen Hong, Zixuan Ni, Hongxing Li

  29. #319Keep It InMind: Benchmarking the Implicit-Association Blind Spot in Agent Memory

    InMind 벤치마크를 통해 기존 메모리 시스템의 암묵적 연관성 탐지 실패 문제를 분석하고, 이에 대한 실험적 결과를 제시한다.

    Ruizhe Li, Mingxuan Du, Benfeng Xu, Zhendong Mao

  30. #320CAST: Game Solvers as Turn-Level Teachers for LLM Agents

    CAST는 게임 솔버의 상태 가치 변화를 기반으로 LLM 에이전트의 턴 수준 신호를 생성하여 강화학습 성능을 향상시킨다.

    Yu Wang, Yi-Kai Zhang, Wentao Shi, Ziang Ye, Yuchun Miao

인기 키워드

reinforcement-learning (271) llm (155) diffusion-models (148) llm-agents (119) vlm (102) video-generation (97) transformer (92) llm-evaluation (88) vision-language (74) long-context (72) code-generation (64) benchmark-evaluation (63) long-horizon (62) retrieval-augmented (58) large-language-models (57) foundation-models (55) benchmarking (53) language-models (53) text-to-image (53) flow-matching (52)