HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-07-23 featured 논문 25편

  1. #1Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning

    Open-AoE는 스마트폰으로 수집된 2,000시간의 제1인칭 조작 영상과 처리 파이프라인, 학습 도구를 제공하는 오픈 인프라이다.

    Zishuo Li, Bowen Yang, Changtao Miao, Kai Zhu, Hao Chen

  2. #2EvolvingWorld: An Open-Schema Framework for Co-Evolving Role-Play Agents and World Model in Interactive Literary World

    EvolvingWorld는 인터랙티브 문학 세계에서 캐릭터와 세계가 공진화하도록 지원하는 오픈스키마 프레임워크와 벤치마크이다.

    Qing Zong, Yue Guo, Mengxin Yang, Yiwen Guo, Yangqiu Song

  3. #3ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU

    ABot-World-0는 단일 데스크톱 GPU에서 실시간으로 장기적이고 일관된 인터랙티브 월드를 생성하는 행동 조건부 비디오 월드 모델이다.

    Fan Jiang, Zhaoxu Sun, Mengchao Wang, Ziyu Zhu, Chiyu Wang

  4. #5DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines

    DataFlow-Harness는 LLM 기반 코드 에이전트가 편집 가능한 DAG 파이프라인을 생성하도록 돕는 플랫폼으로, 12개 태스크에서 93.3%의 종단간 성공률을 달성했다.

    Runming He, Zhen Hao Wong, Hao Liang, Zimo Meng, Chengyu Shen

  5. #6Beyond Output-Space Calibration: Spectral Evidence Bundling for Selective Reliability Estimation in Time-Series Classification

    SEB-Cal은 시간 시계열 분류에서 신뢰도와 스펙트럼 증거를 결합하여 선택적 신뢰성 추정을 개선하는 검증 게이트 기반 정책을 제안한다.

    Filippo Cenacchi, Longbing Cao, Runze Yang

  6. #7AlayaWorld: Interactive Long-Horizon World Modeling -- Full Technical Report

    AlayaWorld는 사용자 입력으로 인터랙티브하고 지속적으로 진화하는 가상 환경을 생성하는 15B 파라미터 비디오 디퓨전 트랜스포머 기반 모델이다.

    AlayaWorld Team, Kaipeng Zhang, Chuanhao Li, Yifan Zhan, Yongtao Ge

  7. #8Apple-π: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence

    Apple-π는 물리 법칙 기반의 비디오 생성 모델 평가를 위한 첫 번째 벤치마크로, 400개의 Orchid 데이터셋과 3단계 프로토콜을 통해 모델의 물리적 추론 능력을 진단한다.

    Runmao Yao, Kairui Hu, Yukang Cao, Ruisi Wang, Shulin Tian

  8. #9TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs

    TimeLens2는 다양한 영상 조건에서 신뢰할 수 있는 시간 구간 추정을 수행하는 다중 모달 대형 언어 모델이다.

    Yuhan Zhu, Changlian Ma, Xiangyu Zeng, Xinhao Li, Zhiqiu Zhang

  9. #10EduPanel: A Three-Agent LLM Judge for Teaching Videos -- Reliability, Complementarity, and Human Trust Calibration

    EduPanel은 학습자 조건에 따른 교육 영상 평가를 위한 3개 에이전트로 구성된 LLM 평가 시스템으로, 전문가 수준의 신뢰도와 보완성을 보인다.

    Jia-Kai Dong, Yi-Cheng Lin, Hung-yi Lee

  10. #11Masked Visual Actions for Unified World Modeling

    Masked Visual Actions는 비디오 모델에 시각적 액션을 주입하여 로봇 월드 모델링을 통합하는 새로운 제어 인터페이스이다.

    Hadi Alzayer, Wenlong Huang, Haonan Chen, Christopher Luey, Lvmin Zhang

  11. #12DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment

    DeepSearch-World는 검증 가능한 환경에서 자기 정제를 통해 웹 에이전트를 훈련하는 프레임워크이다.

    Xinyu Geng, Xuanhua He, Sixiang Chen, Yanjing Xiao, Fan Zhang

  12. #13Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers

    대규모 텍스트-이미지 디퓨전 트랜스포머(DiT)의 내부 메커니즘을 인과적 해석 프레임워크로 분석하고, 템플릿 토큰이 암묵적 의미 레지스터 역할을 한다는 사실을 밝힘.

    Maohua Li, Qirui Li, Yanke Zhou, Yiduo Li, Zhaosheng Chi

  13. #14Generative World Renderer at the Speed of Play

    AlayaRenderer-Flash는 G-buffer 기반 생성 모델을 실시간 렌더링으로 전환하여 0.56 FPS에서 31.54 FPS로 성능을 대폭 향상시킨다.

    Guixu Lin, Zheng-Hui Huang, Siqi Yang, Ming-Hsuan Yang, Kaipeng Zhang

  14. #15HarmoHOI: Harmonizing Appearance and 3D Motion for Multi-view Hand-Object Interaction Synthesis

    HarmoHOI는 2D 비디오와 전역 3D 운동을 통합 생성하는 다중 뷰 핸드-오브젝트 상호작용 합성 프레임워크이다.

    Lingwei Dang, Juntong Li, Zonghan Li, Hongwen Zhang, Liang An

  15. #16BearingNAS: Obtaining In-Sensor Intelligent Fault Diagnosis Systems for Bearings Using a Laptop

    BearingNAS는 센서 내부에서 베어링 고장 진단을 수행하는 저비용 HW-NAS 프레임워크로, ISPU에서 99.50% 정확도를 달성한다.

    Andrea Mattia Garavagno, Edoardo Ragusa, Paolo Gastaldo, Antonio Frisoli, Rodolfo Zunino

  16. #17Dual-domain fused LSTM modeling for efficient time-dependent reliability analysis

    DDF-LSTM 모델을 제안하여 시간 종속 신뢰도 분석의 계산 효율성과 예측 정확도를 동시에 향상시킨다.

    Yixin Zhang, Mingyang Li, Zichao Jiang

  17. #18Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing

    Mage-Flow는 4B 규모의 효율적인 이미지 생성 및 편집 기반 모델로, 고해상도 작업을 낮은 비용으로 가능하게 한다.

    Xinjie Zhang, Peng Zhang, Shicheng Zheng, Jinghao Guo, Zhaoyang Jia

  18. #19HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enchancement

    HOMIE는 인물-객체 중심 동영상 개인화 작업에서 MLLM과 VAE 토큰의 정확한 정렬을 달성한 통합 프레임워크로, GMG와 MRE 모듈을 통해 SOTA 성능을 보인다.

    Yiyang Cai, Nan Chen, Rongchang Xie, Junwen Pan, Chunyang Jiang

  19. #20GigaChat Audio: Time-aware Large Audio Language Model

    GigaChat Audio는 최대 120분의 오디오 입력을 처리하며, 시간 기반 질문에 정확한 타임스탬프를 포함한 답변을 생성하는 시간 인식 대형 오디오 언어 모델이다.

    Aleksandr Kutsakov, Mariia Sadovina, Georgii Gospodinov, Alexandr Maximenko, Oleg Kutuzov

  20. #21FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry

    FlowMimic은 마스크 없이 영상 편집 및 생성을 가능하게 하는 픽셀-쌍 왜곡 흐름 필드를 제안하여 영상 편집 데이터 생성과 모달리티 모방을 실현한다.

    Dingyun Zhang, Lixue Gong, Wei Liu

  21. #22GigaAM Multilingual: Foundation Model for Underrepresented Languages

    GigaAM Multilingual은 2M시간의 오디오로 사전 학습된 Conformer 인코더를 통해 중앙아시아 언어 ASR 성능을 크게 향상시킨다.

    Andrei Kuzmenko, Alexandr Maximenko, Aleksandr Kutsakov, Georgii Gospodinov, Dmitrii Bolotov

  22. #23Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning

    비동기 강화학습의 안정성을 향상시키기 위해 staleness-적응형 신뢰영역(SAT)을 제안한다.

    Junyao Yang, Yucheng Shi, Zongxia Li, Zhongzhi Li, Ruhan Wang

  23. #24ISO: An RLVR-Native Optimization Stack

    ISO는 RLVR에서 가중치 스펙트럼을 고정하고 특이값 프레임만 최적화하는 새로운 최적화 프레임워크이다.

    Hanqing Zhu, Wenyan Cong, Zhizhou Sha, Sagnik Mukherjee, Xinyuan Song

  24. #25ReflectWorld-MM: An Entity-Oriented Multimodal Memory System for Open-Ended Video Streams

    ReflectWorld-MM은 개방형 동영상 스트림을 위한 엔티티 중심 다중 모달 메모리 시스템으로, 6개의 장시간 동영상 벤치마크에서 최고 정확도를 달성했다.

    Xiaokang Ma, Yifan Sun, Zhihong Jin, Jie Gu, Yudong Luo

  25. #26AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents

    AgentDebugX는 LLM 에이전트 실패를 추적·진단·복구하는 반복적 디버깅 프레임워크로, DeepDebug를 핵심으로 정확도와 복구 성능을 향상시킨다.

    Kunlun Zhu, Xuyan Ye, Zhiguang Han, Yuchen Zhao, Bingxuan Li

인기 키워드

reinforcement-learning (255) llm (147) diffusion-models (136) llm-agents (115) vlm (100) video-generation (87) transformer (86) llm-evaluation (82) long-context (69) vision-language (63) benchmark-evaluation (61) code-generation (61) long-horizon (59) retrieval-augmented (55) foundation-models (52) text-to-image (52) flow-matching (50) large-language-models (50) language-models (47) world-models (47)