HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-08-20 featured 논문 30편

  1. #1Large Discovery Models: Empirically-grounded Model-Based Open-Ended Search

    LDM은 생성 모델과 베이지안 비모수 보상 서로게 모델을 결합한, 개방적 가설 공간에서의 효율적 탐색 엔진이다.

    Zhongwei Yu, Yan Song, Xue Yan, Anjie Liu, Xingyu Lu

  2. #2ASI-Bench: At the Dawn of Artificial Superintelligence

    ASI-Bench는 AI가 인간 지침 없이 독자적으로 과학 연구를 수행할 수 있는 능력을 평가하는 첫 번째 벤치마크로, 18개 최신 에이전트-모델 설정에서 평균 점수가 50.91에서 26.62로 급락함을 보여준다.

    Junwei Zhou, Zhen Sun, Binyu Li, Jiangyu Zhou, Yuexi Pan

  3. #3AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge Bases

    AgentPoison는 RAG 기반 LLM 에이전트의 메모리나 지식베이스를 중독하여 공격하는 최초의 백도어 공격 방법이다.

    Zhaorun Chen, Zhen Xiang, Chaowei Xiao, D. Song, Bo Li

  4. #4LightRAG: Simple and Fast Retrieval-Augmented Generation

    LightRAG는 그래프 기반 인덱싱과 이중 수준 검색을 결합하여 RAG 시스템의 정확도와 효율성을 향상시킨다.

    Zirui Guo, Lianghao Xia, Yanhua Yu, Tu Ao, Chao Huang

  5. #5Aya Model: An Instruction Finetuned Open-Access Multilingual Language Model

    Aya는 101개 언어(51개는 저자원 언어)에서 지시사항을 따르는 오픈소스 멀티링구 모델로, mT0와 BLOOMZ보다 대부분의 작업에서 성능이 우수하다.

    A. Ustun, Viraat Aryabumi, Zheng-Xin Yong, Wei-Yin Ko, Daniel D'souza

  6. #6Gated Delta Networks: Improving Mamba2 with Delta Rule

    Gated DeltaNet은 Mamba2와 DeltaNet의 장점을 결합한 새로운 메모리 관리 메커니즘으로, 다양한 벤치마크에서 성능을 개선한다.

    Songlin Yang, Jan Kautz, Ali Hatamizadeh

  7. #7ShortGPT: Layers in Large Language Models are More Redundant Than You Expect

    ShortGPT는 블록 영향(BI) 기반의 단순한 레이어 제거를 통해 LLM의 25% 파라미터 감소와 95% 성능 유지 가능성을 입증한 연구이다.

    Xin Men, Mingyu Xu, Qingyu Zhang, Bingning Wang, Hongyu Lin

  8. #8What matters when building vision-language models?

    Idefics2라는 80억 파라미터의 효율적 VLM을 개발하여 다양한 벤치마크에서 기존 모델 4배 크기와 유사한 성능을 달성했다.

    Hugo Laurençon, Léo Tronchon, Matthieu Cord, Victor Sanh

  9. #9LLaVA-Prumerge: Adaptive Token Reduction for Efficient Large Multimodal Models

    LLaVA-Prumerge는 시각 토큰 수를 4~14배 줄이며 성능 유지하는 적응형 토큰 축소 전략을 제안한다.

    Yuzhang Shang, Mu Cai, Bingxin Xu, Yong Jae Lee, Yan Yan

  10. #10Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents

    UGround는 시각 기반 GUI 에이전트를 위한 강력한 보편적 시각 정착 모델로, 10M GUI 요소를 포함한 대규모 데이터셋으로 학습되어 기존 모델 대비 최대 20% 개선된 성능을 보인다.

    Boyu Gou, Ruohan Wang, Boyuan Zheng, Yanan Xie, Cheng Chang

  11. #11Fast3R: Towards 3D Reconstruction of 1000+ Images in One Forward Pass

    Fast3R은 1,000개 이상의 이미지를 단일 순방향 패스로 처리하는 Transformer 기반 3D 재구성 모델로, DUSt3R 대비 14배 오류 감소와 250 FPS 이상의 추론 속도를 달성한다.

    Jianing Yang, Alexander Sax, Kevin J. Liang, Mikael Henaff, Hao Tang

  12. #12SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference

    SparseVLM은 텍스트 유도적 토큰 최적화를 통해 VLM의 추론 효율성을 향상시키는 훈련 없이 작동하는 메커니즘이다.

    Yuan Zhang, Chunkai Fan, Junpeng Ma, Wenzhao Zheng, Tao Huang

  13. #300DiSCO: Defending text-to-image generation through distribution-guided contrastive prompt optimization

    DiSCO는 텍스트-이미지 생성 모델의 안전성을 향상시키는 블랙박스 방식의 프롬프트 최적화 모듈로, ASR을 23.6%에서 2.4%까지 감소시킨다.

    Tong Zhang, Motasem Alfarra, Carlos Hinojosa, Christos Louizos, Bernard Ghanem

  14. #304StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling

    StateM은 실행 시스템의 확장으로 GPT-5.6 기반 에이전트의 Terminal-Bench 정확도를 95.3%까지 끌어올렸다.

    Ziheng Qin, Yaxin Lu, Zhangyang Atlas Wang, Kai Wang

  15. #306Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization

    SA-MRPO는 다중 보상 최적화에서 포화 상태에 따라 보상 가중치를 동적으로 재조정하여 학습 효율을 향상시킨다.

    Yixuan Wang, Yifei Chen, Haichao Zhang, Haozheng Luo, Xander Wu

  16. #307Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements

    Agentic ESOpt는 GPU 메모리 소요가 적은 진화 전략 기반의 대형 언어 모델 최적화 프레임워크로, WebArena-Lite에서 Qwen3.5-27B 모델을 기반으로 No Skill 기준 대비 6.69% 개선.

    Zhi Zheng, Rongsheng Chen, Yunpeng Ba, Zhenkun Wang, Yee Whye Teh

  17. #308Demystifying Agent Skills: Why They Work-Until They Don't

    LLM 에이전트의 스킬 활용 메커니즘을 체계적으로 분석하여, 언제 작동하고 왜 실패하는지 밝힌 연구.

    Zhiyuan Jiang, Fangrui Huang, Hanwen Xing, Xander Wu, Yipeng Gao

  18. #309Early Cycle Charge Trajectory Generative Prediction and Full Life Cycle Health Management of Iron-Chromium Flow Batteries Based on FlowBD-E1

    FlowBD-E1은 철-크롬 흐름전지의 초기 사이클 데이터만으로 전체 충전 전압/전류 궤적을 0.731% 이하의 오차로 예측하는 생성 모델이다.

    Suyang Zhuang, Zekun Jiang, Tianhang Zhou

  19. #310PROBE: Manipulation-Grounded Visual Question Answering with VLM Agents

    PROBE는 물리적 상호작용이 필요한 질문에 대답하는 VLM 에이전트를 평가하고 미세조정하는 프레임워크로, PROBE-Sim 시뮬레이터와 PROBE-Bench 벤치마크, PROBE-Agent 미세조정 레시피를 제시한다.

    Vineet Bhat, Siyi Chen, Alex Zook, Xuning Yang, Stan Birchfield

  20. #311Energy-Guided Flow Matching

    Energy-Guided Flow Matching(EG-FM)는 고주파 정보를 점진적으로 복원하는 생성 경로를 도입하여 FID 1.45를 달성한 픽셀 공간 생성 모델이다.

    Haoyang Tong, Yu He, Fang Li, Lichen Ma, Jingling Fu

  21. #312Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation

    TAMP-Nav는 2D VLM 사전 학습과 3D 실행 간의 불일치를 해결하며, 효율적인 탐색을 위한 통합 프레임워크로 R2R-CE에서 66.2%의 SR 성능을 달성한다.

    Hongyan Feng, Sunlai Chen, Xuanyu Liu, Miao Pan, Yangfan Xie

  22. #313MOSS-VL Technical Report

    MOSS-VL은 실시간 영상-언어 상호작용을 핵심 기능으로 설계된 오픈 소스 모델로, 11.3B 파라미터와 게이티드 크로스-어텐션을 통해 OmniMMI Proactive Alerting에서 66.0 점을 달성했다.

    Pengyu Wang, Chenkun Tan, Shaojun Zhou, Qirui Zhou, Yanxin Chen

  23. #314FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution

    FreeToken은 35B부터 753B 파라미터 규모의 MoE 모델을 개인 기기에서 효율적으로 실행하는 엣지 네이티브 서빙 시스템이다.

    Shuo Yang, Xiaoze Fan, Melissa Pan, Haocheng Xi, Zhe Wang

  24. #315From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents

    RUPA는 LLM 에이전트의 실행 트래잭토리에 기반한 관계 기반 불확실성 전파를 통해 신뢰도 높은 UQ를 구현한다.

    Zhengzhao Ma. Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

  25. #316Cross-Model Memory Transfer via Target-Side Reader Adaptation

    Engram 스타일 해시 메모리를 타겟 모델에 전달할 때, 메모리 자체보다는 타겟 측 리더의 설계가 성능에 더 큰 영향을 미친다는 것을 실험적으로 입증했다.

    Mingyuan Li, Guangsheng Yu, Xu Wang, Shaoxiong Ji

  26. #317How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks

    AI 연구 에이전트의 실패 원인을 진단하기 위한 100개 과제와 45개 실패 패턴을 제시하는 AutoResearchEval과 ARFT를 소개한다.

    Yanlin Fei, Nazhou Liu, Xinmiao Yu, Shaolong Chen, Lei Li

  27. #318Advancing Open and Reproducible Relational Learning: RelArena-α, TabPFN-Rel and RPI

    Prior Labs는 RelArena-α, TabPFN-Rel, RPI를 오픈소스로 발표하며 관계 학습 연구의 재현성과 비교성을 강화한다.

    Adrian Hayler, Klemens Flöge, Alan Arazi, Rishabh Ranjan, Jure Leskovec

  28. #319EDITBRIDGE: Towards Faithful and Efficient Ultra-High-Resolution Image Editing

    EditBridge는 초고해상도 이미지 편집에서 정보 분산과 텍스처 저하 문제를 해결하며 4K 편집을 61초 내 수행하는 확률적 다리 기반 프레임워크이다.

    Jiayi Song, Shijie Huang, Fangtai Wu, Yubo Huang, Zhenxiong Tan

  29. #320HarmProfile: Characterizing Harmful Distributions in Frontier LLMs

    HarmProfile은 23개 프런티어 LLM의 해로운 출력을 분석하여 모델별 위험 프로필을 정의한 대규모 벤치마크 데이터셋이다.

    Zhouyuan Ma, Yutao Wu, Hanxun Huang, Xiang Zheng, Xiao Liu

  30. #321DumpsterCluster: From Dumpster Diving to Serving LLaMA-70B on $60 GPUs

    128개의 중고 V100 GPU로 구성된 DumpsterCluster를 통해 LLaMA-70B 추론을 $22K에 구현하며, 에너지 및 탄소 조건에 따라 경제적·환경적 이점을 분석.

    Zeyu Cao, Xuan Guo, Cheng Zhang, Cheuk Hang Lau, Ilia Shumailov

인기 키워드

reinforcement-learning (331) diffusion-models (190) llm (190) llm-agents (160) video-generation (129) transformer (126) llm-evaluation (125) vision-language (112) vlm (109) long-context (99) large-language-models (94) code-generation (88) long-horizon (86) benchmark-evaluation (82) benchmarking (80) language-models (75) retrieval-augmented (73) flow-matching (68) world-models (68) foundation-models (67)