HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-07-22 featured 논문 25편

  1. #1Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning

    Open-AoE는 스마트폰으로 수집된 2,000시간의 제1인칭 조작 영상과 처리 파이프라인, 학습 도구를 제공하는 오픈 인프라이다.

    Zishuo Li, Bowen Yang, Changtao Miao, Kai Zhu, Hao Chen

  2. #2EvolvingWorld: An Open-Schema Framework for Co-Evolving Role-Play Agents and World Model in Interactive Literary World

    EvolvingWorld는 인터랙티브 문학 세계에서 캐릭터와 세계가 공진화하도록 지원하는 오픈스키마 프레임워크와 벤치마크이다.

    Qing Zong, Yue Guo, Mengxin Yang, Yiwen Guo, Yangqiu Song

  3. #3Group Entropy-Controlled Policy Optimization

    GEPO는 GRPO를 확장한 그룹 기반 정책 최적화 알고리즘으로, 이질적 태스크의 탐색-활용 균형을 개선한다.

    Guangran Cheng, Chengqi Lyu, Songyang Gao, Wenwei Zhang, Kai Chen

  4. #4Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories

    Xiaomi-Robotics-1은 10만 시간 이상의 실제 조작 데이터로 학습한 VLA 모델로, RoboCasa365에서 57.6% 성공률을 달성했다.

    Xiaomi Robotics Team, Jun Guo, Piaopiao Jin, Jason Li, Peiyan Li

  5. #5Apple-π: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence

    Apple-π는 물리 법칙 기반의 비디오 생성 모델 평가를 위한 첫 번째 벤치마크로, 400개의 Orchid 데이터셋과 3단계 프로토콜을 통해 모델의 물리적 추론 능력을 진단한다.

    Runmao Yao, Kairui Hu, Yukang Cao, Ruisi Wang, Shulin Tian

  6. #6RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model

    RynnBrain 1.1은 2B, 9B, 122B-A10B 규모의 신형 탐지-이해-작업 통합 모델로, 3D 정착 및 접촉점 예측을 통해 로봇 조작 성능을 향상시킨다.

    Kehan Li, Bohan Hou, Minghao Zhu, Tianyi Zhang, Zesen Cheng

  7. #7TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs

    TimeLens2는 다양한 영상 조건에서 신뢰할 수 있는 시간 구간 추정을 수행하는 다중 모달 대형 언어 모델이다.

    Yuhan Zhu, Changlian Ma, Xiangyu Zeng, Xinhao Li, Zhiqiu Zhang

  8. #8RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources

    RESOURCE2SKILL은 멀티모달 자료를 실행 가능한 에이전트 스킬로 추출하는 프레임워크로, 7개 도메인에서 평균 +11.9% 성능 향상을 보인다.

    Yijia Fan, Zonglin Di, Zimo Wen, Yifan Yang, Mingxi Cheng

  9. #9RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM

    RAGU는 다단계 그래프 기반 RAG 엔진으로, Meno-Lite-0.1이라는 7B 언어 기술 최적화 모델을 통해 그래프 추출 정확도를 12.5% 개선한다.

    Mikhail Komarov, Ivan Bondarenko, Stanislav Shtuka, Oleg Sedukhin, Roman Shuvalov

  10. #10DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment

    DeepSearch-World는 검증 가능한 환경에서 자기 정제를 통해 웹 에이전트를 훈련하는 프레임워크이다.

    Xinyu Geng, Xuanhua He, Sixiang Chen, Yanjing Xiao, Fan Zhang

  11. #11SWE-Pruner Pro: The Coder LLM Already Knows What to Prune

    SWE-Pruner Pro는 코드 생성 에이전트 내부 표현을 활용해 툴 출력을 직접 줄이며, 토큰 소비를 최대 39% 절감하고 성능을 유지한다.

    Yuhang Wang, Yuling Shi, Shaoqiu Zhang, Jialiang Liang, Shilin He

  12. #12Partially Correlated Verifier Cascades in LLM Harnesses: Concave Log-Odds, Polynomial Reliability, and Blind-Spot Ceilings

    LLM 검증 게이트의 부분적 상관성을 수학적으로 모델링하여, 신뢰도의 폴리노미얼 감소와 상한선을 정량화한다.

    Jiangang Han

  13. #13RobustMAD: Evaluating Real-World Robustness of Multimodal Small Language Models for Deployable Anomaly Detection Assistants

    RobustMAD는 산업 현장에서 사용 가능한 MSLM의 실무적 안정성을 평가하기 위한 첫 번째 벤치마크로, GPT-5 Nano를 초과하는 성능을 보이지만 여전히 안전 기준 미달.

    Anushiya Arunan, Xin Li, Yan Qin, U-Xuan Tan, Nhu Khue Vuong

  14. #14HarmoHOI: Harmonizing Appearance and 3D Motion for Multi-view Hand-Object Interaction Synthesis

    HarmoHOI는 2D 비디오와 전역 3D 운동을 통합 생성하는 다중 뷰 핸드-오브젝트 상호작용 합성 프레임워크이다.

    Lingwei Dang, Juntong Li, Zonghan Li, Hongwen Zhang, Liang An

  15. #15HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enchancement

    HOMIE는 인물-객체 중심 동영상 개인화 작업에서 MLLM과 VAE 토큰의 정확한 정렬을 달성한 통합 프레임워크로, GMG와 MRE 모듈을 통해 SOTA 성능을 보인다.

    Yiyang Cai, Nan Chen, Rongchang Xie, Junwen Pan, Chunyang Jiang

  16. #16GigaChat Audio: Time-aware Large Audio Language Model

    GigaChat Audio는 최대 120분의 오디오 입력을 처리하며, 시간 기반 질문에 정확한 타임스탬프를 포함한 답변을 생성하는 시간 인식 대형 오디오 언어 모델이다.

    Aleksandr Kutsakov, Mariia Sadovina, Georgii Gospodinov, Alexandr Maximenko, Oleg Kutuzov

  17. #17GigaAM Multilingual: Foundation Model for Underrepresented Languages

    GigaAM Multilingual은 2M시간의 오디오로 사전 학습된 Conformer 인코더를 통해 중앙아시아 언어 ASR 성능을 크게 향상시킨다.

    Andrei Kuzmenko, Alexandr Maximenko, Aleksandr Kutsakov, Georgii Gospodinov, Dmitrii Bolotov

  18. #18ReflectWorld-MM: An Entity-Oriented Multimodal Memory System for Open-Ended Video Streams

    ReflectWorld-MM은 개방형 동영상 스트림을 위한 엔티티 중심 다중 모달 메모리 시스템으로, 6개의 장시간 동영상 벤치마크에서 최고 정확도를 달성했다.

    Xiaokang Ma, Yifan Sun, Zhihong Jin, Jie Gu, Yudong Luo

  19. #19FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry

    FlowMimic은 마스크 없이 영상 편집 및 생성을 가능하게 하는 픽셀-쌍 왜곡 흐름 필드를 제안하여 영상 편집 데이터 생성과 모달리티 모방을 실현한다.

    Dingyun Zhang, Lixue Gong, Wei Liu

  20. #20REBASE: Reference-Background Subspace Elimination for Training-Free In-Context Segmentation

    REBASE는 훈련 없이 배경 특성 공간을 제거하여 단일 참조 이미지로 쿼리 이미지의 세그멘테이션 성능을 향상시키는 새로운 인-컨텍스트 세그멘테이션 프레임워크이다.

    Mantha Sai Gopal, Jaison Saji Chacko, Harsh Nandwana, Sandesh Hegde, Debarshi Banerjee

  21. #21Qwen-Music Technical Report

    Qwen-Music은 텍스트와 레퍼런스 음악 기반으로 고음질 음악을 생성하는 대규모 음악 생성 모델로, Melody-CoT와 Qwen-Music-Render를 통해 창의성과 음향 품질을 동시에 향상시킨다.

    Jin Xu, Kangdi Wang, Ruibin Yuan, Shun Lei, Xiong Wang

  22. #22ReViV: Reconstructing the Viewer and the View in 4D from Monocular Egocentric Video

    ReViV는 단일 모노카메라 영상에서 시청자와 환경의 4D 재구성을 동시에 수행하는 통합 프레임워크로, 다양한 벤치마크에서 최고 성능을 달성한다.

    Xiaozhong Lyu, Gen Li, Zhiyin Qian, Xucong Zhang, Marc Pollefeys

  23. #23Environment-free Synthetic Data Generation for API-Calling Agents

    LLM을 활용한 API 호출 에이전트 학습용 환경 없는 합성 데이터 생성 방법 제시.

    Seanie Lee, Sanjoy Chowdhury, Chao Jiang, Cheng-Yu Hsieh, Ting-Yao Hu

  24. #24When Does Muon Help Agentic Reinforcement Learning?

    Muon이 GiGPO 기반의 장기적 희소보상 에이전트 강화학습에서 AdamW 대비 88% 성능 향상을 보인다.

    Kai Ruan, Jinghao Lin, Zihe Huang, Ziqi Zhou, Qianshan Wei

  25. #25Do Language Models Dream of Binding Molecules? Benchmarking LLMs under Spatial Constraints

    LLM이 공간 제약 조건 하에서 분자 생성 능력을 평가하는 벤치마크 3D-Fit을 제안하고 분석한다.

    Thomas MacDougall, Maksim Kuznetsov, Roman Schutski, Rim Shayakhmetov, Maxim Malkov

인기 키워드

reinforcement-learning (253) llm (147) diffusion-models (134) llm-agents (113) vlm (100) transformer (86) video-generation (84) llm-evaluation (82) long-context (69) vision-language (62) benchmark-evaluation (61) code-generation (59) long-horizon (58) retrieval-augmented (55) foundation-models (52) text-to-image (51) flow-matching (50) large-language-models (49) language-models (47) world-models (47)