HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-08-11 featured 논문 30편

  1. #1Uncertainty-Aware World Model for Aerial Image-Goal Navigation

    UA-NWM은 미래 상태의 불확실성을 고려한 항공 이미지-목표 탐색을 위한 효율적인 월드 모델이다.

    Deyi Zhu, Haoyu Fan, Yinan Zhu, Weichen Zhang, Shilin Ma

  2. #2Improved Distribution Matching Distillation for Fast Image Synthesis

    DMD2는 분포 일치 기반 지도 학습을 통해 단계 수를 500배 줄이며 FID 1.28의 높은 품질 이미지를 생성한다.

    Tianwei Yin, Michael Gharbi, Taesung Park, Richard Zhang, Eli Shechtman

  3. #3MVSplat: Efficient 3D Gaussian Splatting from Sparse Multi-View Images

    MVSplat은 22fps의 빠른 추론 속도와 10배 적은 파라미터로, RealEstate10K 및 ACID 벤치마크에서 최고 성능을 달성한 효율적인 3D Gaussian Splatting 모델이다.

    Donny Y. Chen, Haofei Xu, Chuanxia Zheng, Bohan Zhuang, M. Pollefeys

  4. #4Benchmarking Retrieval-Augmented Generation for Medicine

    의학 분야에서 RAG 시스템의 최적 설정을 평가하기 위한 MIRAGE 벤치마크와 MedRAG 툴킷을 제안하고, 1.8조 개의 프롬프트 토큰을 기반으로 41가지 조합 실험을 수행한 연구.

    Guangzhi Xiong, Qiao Jin, Zhiyong Lu, Aidong Zhang

  5. #5VideoMamba: State Space Model for Efficient Video Understanding

    VideoMamba는 Mamba 기반 SSM을 활용해 비디오 이해를 효율적으로 수행하는 새로운 모델로, 장단기 동작 인식 및 멀티모달 호환성을 뛰어넘는 성능을 보인다.

    Kunchang Li, Xinhao Li, Yi Wang, Yinan He, Yali Wang

  6. #6JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

    JailbreakBench는 대형 언어 모델의 탈옥 공격을 평가하기 위한 오픈 소스 벤치마크이다.

    Patrick Chao, Edoardo Debenedetti, Alexander Robey, Maksym Andriushchenko, Francesco Croce

  7. #7SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents

    SeeClick은 GUI 화면 캡처만을 기반으로 작업을 자동화하는 시각 기반 GUI 에이전트로, GUI grounding을 강화한 결과 ScreenSpot 벤치마크에서 기존 LVLM 기반 모델을 상회한다.

    Kanzhi Cheng, Qiushi Sun, Yougang Chu, Fangzhi Xu, Yantao Li

  8. #8Executable Code Actions Elicit Better LLM Agents

    CodeAct는 LLM 에이전트가 실행 가능한 Python 코드를 생성하여 행동을 통합하고, 20% 높은 성공률을 달성하는 새로운 프레임워크이다.

    Xingyao Wang, Yangyi Chen, Lifan Yuan, Yizhe Zhang, Yunzhu Li

  9. #9MOMENT: A Family of Open Time-series Foundation Models

    MOMENT는 다양한 시간 시계열 분석을 위한 오픈소스 기초 모델로, Time-series Pile 데이터셋과 마스킹 기반 사전 학습을 통해 제한된 데이터에서도 뛰어난 성능을 보인다.

    Mononito Goswami, Konrad Szafer, Arjun Choudhry, Yifu Cai, Shuo Li

  10. #10KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache

    KIVI는 튜닝 없이 키-벨류 캐시를 2비트로 양자화하여 LLM 추론 메모리 사용량을 2.6배 감소시키는 알고리즘이다.

    Zirui Liu, Jiayi Yuan, Hongye Jin, Shaochen Zhong, Zhaozhuo Xu

  11. #11BLINK: Multimodal Large Language Models Can See but Not Perceive

    BLINK는 시각 인지 능력을 평가하는 새로운 멀티모달 LLM 벤치마크로, 인간은 쉽게 풀지만 기존 모델은 어려움을 겪는다.

    Xingyu Fu, Yushi Hu, Bangzheng Li, Yu Feng, Haoyu Wang

  12. #100World-to-Wrist: Task-Conditioned Future Wrist Modeling for Fine-Grained Robot Manipulation

    W2-VLA는 글로벌 작업 맥락을 고려한 미래 손목 움직임 예측을 통해 정밀 로봇 조작 성능을 향상시키는 VLA 모델이다.

    Yuhao Pan, Haosong Peng, Zhengshen Zhang, Zhengyang Yan, Yalun Dai

  13. #303EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning

    EnvACE는 외부 환경 없이 정책이 자체적으로 환경 응답을 생성하는 월드 리허설을 통해 강화 학습 에이전트를 학습하는 새로운 방법이다.

    Zishan Xu, Zhiyuan Yao, Yuxin Chen, Yifu Guo, Zhengxi Lu

  14. #304From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models

    경제 세계 모델(EWM) 구현을 위한 시스템 설계와 6단계 능력 구조를 제시하며, AI 및 인간 의사결정자용 고정밀 시뮬레이션 환경 개발을 촉진한다.

    Jiale Han, Xiang Li, Jing Qian, Wenyuan Gu, Pin Gao

  15. #305DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces

    DataSpace는 410개의 다국어 작업 공간을 기반으로, 데이터 에이전트의 정확한 테이블 결과 생성 능력을 평가하는 벤치마크로, 최고 정확도는 66.34%에 달한다.

    Boyan Li, Zhuowen Liang, Yupeng Xie, Xiaotian Lin, Tianqi Luo

  16. #306DCAS: Decoupling CLI Agent Scaffolding to Internalize Planning across Scaffolds

    DCAS는 CLI 에이전트의 플래닝 구조를 학습 가능한 모델 기능으로 전환하여 다양한 스크래프에서의 성능 저하를 해결한다.

    Kishanthan Thangarajah, Boyuan Chen, Ahmed E. Hassan

  17. #307Interpretable MEG Decoding of Perceived Speech: Cortical Sources and the Stimulus Features That Drive Retrieval

    MEG 신호에서 인지된 음성 재구성을 위해 해석 가능한 디코더를 설계하고, 그 기저 뇌 활성과 자극 특성을 분석한다.

    Ilia Semenkov, Daria Kleeva, Ivan Dakhtin, Zarina Maksudova, Alex Ossadtchi

  18. #308OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

    OSReward는 컴퓨터 사용 에이전트(CUA)의 성능을 평가하는 VLM 판정 모델의 신뢰도를 체계적으로 평가하고, 저비용으로 신뢰할 수 있는 보상 신호를 제공하는 오픈 벤치마크와 모델을 제시한다.

    Qiushi Sun, Kanzhi Cheng, Yian Wang, Bowen Yang, Hang Yan

  19. #309When Activation Oracles Learn Not to Read: Concept-Specific Blind Spots in Fine-Tuned Oracles

    AO가 훈련된 개념을 의도적으로 회피하는 현상을 밝혀내며, 학습된 해석 도구의 신뢰성 문제를 제기한다.

    Tobias Bersia, Tatiana Gaintseva

  20. #310Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills

    로봇 학습은 고정된 가중치와 자가 개선 가능한 스킬이라는 두 축으로 나뉘고 있다.

    Gaytri Jena, Kapil Wanaskar, Vinija Jain, Aman Chadha, Vasu Sharma

  21. #311Douyin Multimodal Embedding Model Technical Report

    도우틴(Douyin)은 대규모 멀티모달 임베딩 모델 DME를 제안하여 검색 및 추천 성능을 향상시켰다.

    Haonan Chen, Chu Li, Zhicheng Wang, Yuanwei Liu, Yuanjiang Wang

  22. #312SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs

    SFT는 다단계 학습에서 성능 저하를 겪지만, RL은 거의 직교적인 업데이트로 안정적 성능 향상을 보인다.

    Kejian Zhu, Zhuoran Jin, Shangqing Tu, Hongbang Yuan, Yushi Bai

  23. #313Do AI Personas Grow? Analyzing and Benchmarking Personality Evolution in LLM Agents After Life Events

    LLM 에이전트의 성격 변화를 인간 심리학 데이터와 비교해 평가하는 새로운 벤치마크를 제시한다.

    Ming Wang, Peidong Wang, Xiaocui Yang, Daling Wang, Shi Feng

  24. #314Teaching Nemotron Greek: Mining a Corpus, Adapting Retrieval, and Grounding Generation for Modern Greek across Specialist Domains

    현대 그리스어를 위한 Nemotron 검색 모델과 RAG 벤치마크 HERA를 구축하고 성능을 개선했다.

    Ayoub Kirouane, Christos Petrocheilos

  25. #315Beyond Simply Environment Scaling: Designing Effective Environment Distributions for Multimodal Agent Learning

    AES와 HDC를 통해 다중모달 에이전트 학습의 환경 분포를 효과적으로 설계하는 방법을 제안한다.

    Kejian Zhu, Zhuoran Jin, Dongqi Huang, Hongbang Yuan, Yupu Hao

  26. #316Characterizing the Quality Profile of AI-Generated C++ in Production

    AI 생성 C++ 코드는 인터페이스 및 메모리 관리 문제로 인해 5-8%의 컴퓨팅 비용 증가를 초래하지만, 분류기반 피드백으로 11.1%의 경고 감소를 달성.

    Michael Tran, Fred Lewis, Kun Yang, Saksham Thakur, Aditya Kini

  27. #317Activity Frames: Deterministic Screen-Activity Compilation for Agent Memory and Replay

    "Activity Frames"는 사용자의 스크린 활동을 결정론적 컴파일로 변환하여 에이전트 메모리의 신뢰성과 효율성을 높인다.

    Nossa Iyamu

  28. #318SimWAM: A Simple World Action Model for End-to-End Autonomous Driving

    SimWAM은 비용이 많이 드는 미래 프레임 생성 없이도 높은 성능을 보이는 간단한 월드-액션 모델로, NAVSIM에서 91.5 PDMS를 달성한다.

    Zongchuang Zhao, Xin Zhou, Tianyang Xu, Zhengyang Sun, Kaixuan Zhou

  29. #319PaDoc: Layout-Grounded Parallel Decoding for Document Parsing

    PaDoc은 레이아웃 기반 병렬 디코딩을 통해 문서 파싱의 처리 속도와 정확도를 동시에 향상시킨 단일 MLLM 기반 모델이다.

    Hao Yu, Jiabo Zhan, Kang Liu, Linnan Zhao, Dongxu Yue

  30. #320KVAE: Family of Tokenizers for Multimodal Generative Models

    KVAE는 텍스트 조건을 기반으로 생성하는 멀티모달 모델을 위한 새로운 토크나이저 시리즈로, 이미지, 비디오, 오디오에서 기존 오픈소스 토크나이저를 능가하는 성능을 보인다.

    Andrey Shutkin, Denis Parkhomenko, Ivan Kirillov, Kirill Chernyshev, Kirill Malakhov

인기 키워드

reinforcement-learning (331) diffusion-models (190) llm (190) llm-agents (160) video-generation (129) transformer (126) llm-evaluation (125) vision-language (112) vlm (109) long-context (99) large-language-models (94) code-generation (88) long-horizon (86) benchmark-evaluation (82) benchmarking (80) language-models (75) retrieval-augmented (73) flow-matching (68) world-models (68) foundation-models (67)