HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-09-21 featured 논문 30편

  1. #2Benchmarking LLMs via Uncertainty Quantification

    LLM 평가에 불확실성 측정을 통합한 새로운 벤치마킹 방법을 제안하며, 9개 모델을 5개 NLP 태스크에서 평가한 결과를 제시한다.

    Fanghua Ye, Mingming Yang, Jianhui Pang, Longyue Wang, Derek F. Wong

  2. #3Predictive Inverse Dynamics Models are Scalable Learners for Robotic Manipulation

    Seer는 시각-작업 루프를 통합한 예측적 역 역학 모델(PIDM)로, 대규모 데이터 학습을 통해 시뮬레이션 및 실제 환경에서 기존 방법 대비 13~43% 성능 향상.

    Yang Tian, Sizhe Yang, Jia Zeng, Ping Wang, Dahua Lin

  3. #6A Roadmap to Pluralistic Alignment

    AI 시스템이 다양한 인간 가치를 반영하도록 정렬하는 "플러럴리즘 정렬"을 위한 구체적 로드맵을 제안한다.

    Taylor Sorensen, Jared Moore, Jillian R. Fisher, Mitchell Gordon, Niloofar Mireshghallah

  4. #7Imagine while Reasoning in Space: Multimodal Visualization-of-Thought

    MVoT는 시각적 추론을 통해 MLLM의 공간적 추론 능력을 향상시키는 새로운 추론 패러다임이다.

    Chengzu Li, Wenshan Wu, Huanyu Zhang, Yan Xia, Shaoguang Mao

  5. #8LLaGA: Large Language and Graph Assistant

    LLaGA는 그래프 구조 데이터를 LLM과 호환 가능한 토큰 임베딩 공간으로 매핑하여 다양한 그래프 작업에서 뛰어난 성능을 보이는 통합 모델이다.

    Runjin Chen, Tong Zhao, Ajay Jaiswal, Neil Shah, Zhangyang Wang

  6. #9Don't Hallucinate, Abstain: Identifying LLM Knowledge Gaps via Multi-LLM Collaboration

    다중 LLM 협력 기반 Cooperte 및 Compete 메커니즘을 통해 LLM 지식 공백을 최대 19.3% 개선된 정확도로 식별하고 답변을 회피한다.

    Shangbin Feng, Weijia Shi, Yike Wang, Wenxuan Ding, Vidhisha Balachandran

  7. #10Mobile-Agent-v2: Mobile Device Operation Assistant with Effective Navigation via Multi-Agent Collaboration

    Mobile-Agent-v2는 다중 에이전트 협업을 통해 모바일 기기 작업을 효율적으로 수행하는 시스템으로, 단일 에이전트 대비 30% 이상의 작업 완료율 향상을 보인다.

    Junyang Wang, Haiyang Xu, Haitao Jia, Xi Zhang, Ming Yan

  8. #11Retrieval Head Mechanistically Explains Long-Context Factuality

    LLaMA-2 7B 등 다양한 모델에서 정보 검색을 담당하는 'retrieval head'가 존재하며, 이는 hallucination과 추론 성능에 직접적인 영향을 미친다.

    Wenhao Wu, Yizhong Wang, Guangxuan Xiao, Hao Peng, Yao Fu

  9. #12Aya Dataset: An Open-Access Collection for Multilingual Instruction Tuning

    Aya Dataset은 65개 언어의 20만 개 이상의 인간 주도 인스트럭션-완료 쌍을 포함한 최대 규모의 오픈소스 다국어 학습 데이터셋이다.

    Shivalika Singh, Freddie Vargus, Daniel Dsouza, Börje F. Karlsson, Abinaya Mahendiran

  10. #13MetaMorph: Multimodal Understanding and Generation via Instruction Tuning

    MetaMorph는 VPiT를 통해 텍스트와 시각 토큰을 생성하는 통합 모델로, 시각 이해와 생성 모두에서 경쟁력 있는 성능을 보인다.

    Shengbang Tong, David Fan, Jiacheng Zhu, Yunyang Xiong, Xinlei Chen

  11. #307Don't Mask the Environment: Observation Supervision Changes How Agents Explore Under RL

    ActObs는 환경 관측값을 예측 대상으로 포함시켜 강화학습 초기화를 개선하여 GRPO 후 탐색 성능을 향상시킨다.

    Juzheng Zhang, Disha Makhija, Manoj Ghuhan Arivazhagan, Vinayshekhar Bannihatti Kumar, Rashmi Gangadharaiah

  12. #308VākQA: A Benchmark and Evaluation Study for Telugu Spoken Factoid Question Answering

    텔루구어 음성 기반 팩트오이드 QA 벤치마크 VākQA를 제안하고, 평가 방법과 모델 성능을 분석한다.

    Bhavana Akkiraju, Ravi Sastry Kolluru, Sri Charan D, Srihari Bandarupalli, Santosh Kesiraju

  13. #310Can MiniMax-H3 Reason About the Physical World? An Evaluation of Omni-Modal Generative Model

    MiniMax-H3의 물리적 세계 추론 능력을 다중 모달 입력 기반 평가 프레임워크로 평가한 연구.

    Haoyu Zhao, Zihao Zhao, Tianyu Deng, Ziqin Xu, Zihao Zhang

  14. #311When EOS Tokens Disagree: Understanding Length Inflation in On-Policy Distillation

    OPD에서 길이 과장 문제를 유발하는 EOS 토큰 불일치를 분석하고, 이를 해결하기 위한 종단 동작 정렬 전략을 제안한다.

    Yuxiao Yang, Tianrun Yu, Shangzhe Li, Kaixiang Zhao, Xuchao Zhang

  15. #317JEPA-Anything: Learning Predictive Models across Different Worlds

    JEPA-Anything는 다양한 도메인에서 예측 모델링을 가능하게 하는 통합 프레임워크로, 정교한 인자 분해와 재사용 가능한 예측 구조를 통해 성능을 향상시킨다.

    Taoyong Cui, Zhongyao Wang, Xinyue Xu, Weiyang Liu, Zhaochen Yu

  16. #321Verifiable Social Reasoning for LLM Assistants

    LLM 어시스턴트의 일상적 사회적 추론 능력을 평가하기 위한 새로운 시뮬레이션 프레임워크 Fuse를 제안하고, 12개 모델을 분석하여 사용자 매개 변수의 영향을 밝혀냈다.

    Amir Taubenfeld, Zorik Gekhman, Avigail Grinstein-Dabush, Itay Laish, Ariel Goldstein

  17. #323Self-Evolving Search Index

    SELF-INDEX는 인덱스 키를 자동 진단·수정·검증하는 프레임워크로, 다양한 검색 환경에서 검색 성능을 지속적으로 향상시킨다.

    Sangam Lee, Wonjae Lee, Sunghwan Kim, Deogyong Kim, Jaehoon Kim

  18. #324RiskChainBench: A Benchmark for Obfuscated Platform Message Restoration and Evidence-Grounded Web Investigation

    RiskChainBench는 위장된 메시지 복원과 증거 기반 웹 조사의 연계성을 평가하는 새로운 벤치마크로, 3,600개의 토큰-텍스트 입력과 600개의 로컬 웹 환경을 제공한다.

    ZhuoXin Liu, Zhiming Ma, Ying Zhang, Mengzheng Yang, Yifan Wang

  19. #325RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning

    RetireOPD는 강화학습 기반 에이전트에 기술 정보를 내재화하는 자가 퇴역형 온-폴리시 디스틸레이션 방법으로, ALFWorld와 WebShop에서 성능을 11.8%~18.8% 개선한다.

    Yan Yu, Zhengxi Lu, Yizhou Liu, Yichen Pan, Aozhe Wang

  20. #327Reflect, Revise, Reuse: Training-Free Skill Evolution for GUI Agents

    EvoSkill-GUI는 GUI 에이전트의 실행 피드백을 기반으로 훈련 없이 스킬을 수정하는 반복 루프를 통해 성능을 향상시킨다.

    Bofan Chen, Boxuan Zhang, Fei Tang, Zhengxi Lu, Yong Du

  21. #328WeVisDoc: From Coverage to Capability for Robust End-to-End Document Parsing

    WeVisDoc은 두 단계의 데이터 중심 프레임워크로, 다양한 문서 파싱 성능을 95.38 (OmniDocBench v1.6)까지 향상시킨다.

    Hao Yu, Kang Liu, Linnan Zhao, Jiabo Zhan, Chong Sun

  22. #329Video DeltaNet: A Video-Native Hybrid Attention for Livestream Video Generation

    Video DeltaNet(VDN)은 영상 생성 속도를 14.5× 향상시키는 하이브리드 어텐션 구조를 제안한다.

    Haocheng Xi, Yiming Xie, Hexu Zhao, Yiwen Zhang, Michael Liu

  23. #331VABench: Measuring Embodied Spatial Intelligence through Visual Demonstrations, Active Perception, and Metric Control

    VABench는 시각 시연, 능동적 관찰, 메트릭 제어를 통해 MLLM의 공간 지능을 종합적으로 평가하는 벤치마크이다.

    Zhongbo Zhang, Jiayi Jin, Yifan Wang, Zaibin Zhang, Haiwen Diao

  24. #332When2Think: Learning Difficulty-Aware Length Control for Efficient Hybrid Reasoning Models

    When2Think는 문제 난이도에 따라 추론 깊이를 조절하여 효율적인 하이브리드 추론을 학습하는 포스트-트레이닝 프레임워크이다.

    Jaejun Shim, HyunJin Kim, Young Jin Kim, JinYeong Bak

  25. #333What Does Privileged Information Add to On-Policy Self-Distillation?

    On-policy self-distillation에서 privileged information의 추가 가치를 AMPLE-Math 데이터셋을 통해 분리 평가한 연구.

    XiuYu Zhang, Wei Chow, Junfeng Fang, Zhenkai Liang, Tat-Seng Chua

  26. #334UFO: Chain-of-Evaluation for Omni-Condition Alignment in Multi-Modal Image Generation

    UFO는 다중 조건 일치 평가를 위한 체인형 평가 프레임워크로, 기존 방법 대비 15.25% 높은 인간 평가와의 상관성을 달성했다.

    Danning Zhang, Yijing Lin, Shuhan Zhuang, Mengqi Huang, Shaojin Wu

  27. #335Sample Count Is Not Enough: Candidate-Generation Strategy Shapes the Energy and Performance of LLM Test-Time Scaling

    테스트 타임 스케일링에서 후보 생성 방식이 성능과 에너지 소비에 큰 영향을 미친다.

    Mobina Kashaniyan, Ali Jannesari

  28. #336FAMOS: Feed-Forward 3D Articulation Modeling from Sparse Observations

    FAMOS는 희소한 단일 뷰에서 3D 조인트 모델링을 수행하는 피드포워드 모델로, Multi-state Articulation Transformer와 observed articulation span loss를 통해 정확도를 향상시킨다.

    Kevin Qu, Tao Sun, Massimiliano Viola, Liyuan Zhu, Zhizhuo Zhou

  29. #337Region-Level Policy Optimization for Fine-grained MLLM Perception

    Vision-RL2는 MLLM에서 지역 수준 강화 학습을 통해 시각 토큰 수를 4배 줄이며 정확도를 향상시키는 지역 선택 최적화 방법이다.

    Yuheng Shi, Xiaohuan Pei, Minjing Dong, Chang Xu

  30. #338Srijika: OpenType-Layout-Reusing Font Restyling for Nine Indic Scripts

    Srijika는 9개의 브라흐미 글꼴 스크립트에 대한 OpenType 레이아웃 재사용 기반 글꼴 리스타일링 시스템이다.

    Anil Pai

인기 키워드

reinforcement-learning (363) diffusion-models (211) llm (209) llm-agents (169) video-generation (144) llm-evaluation (143) transformer (139) vision-language (131) large-language-models (114) long-context (113) vlm (110) code-generation (100) long-horizon (93) benchmark-evaluation (92) language-models (89) benchmarking (87) retrieval-augmented (80) foundation-models (78) world-models (73) flow-matching (72)