HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-08-13 featured 논문 30편

  1. #1Co-Evolution in Agentic Systems: Toward Self-Directed Evolution Beyond Human Design

    본 논문은 에이전트 시스템에서의 공동진화(co-evolution)를 다층적 세 단계 분류로 체계화하고, 인간 설계를 벗어난 자기 주도적 진화의 가능성을 탐색한다.

    Qing Zong, Jiayu Liu, Junhao Shen, Zecong Tang, Linsi Wu

  2. #2Physics-Informed Machine Learning in Prognostics and Health Management: A Systematic Literature Review

    PIML을 PHM에 적용한 212개 연구를 체계적으로 검토하여, 성능 개선 효과와 한계를 분석하고 미래 연구 방향을 제시한다.

    Christopher Braun, Julian Raible, Marco F. Huber

  3. #3Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning

    고량이 높은 소수의 토큰(포킹 토큰)을 선택적으로 최적화함으로써 Qwen3-32B 기반 모델에서 AIME'25에서 +11.04, AIME'24에서 +7.71의 성능 향상이 관찰되었다.

    Shenzhi Wang, Le Yu, Chang Gao, Chujie Zheng, Shixuan Liu

  4. #4A Survey on RAG Meeting LLMs: Towards Retrieval-Augmented Large Language Models

    RAG를 활용한 대규모 언어 모델(RA-LLMs)의 연구 동향과 기술적 한계를 체계적으로 조사한 서베이 논문.

    Wenqi Fan, Yujuan Ding, Liang-bo Ning, Shijie Wang, Hengyun Li

  5. #5Evaluating Text-to-Visual Generation with Image-to-Text Generation

    VQAScore를 제안하여 CLIPScore보다 향상된 텍스트-비주얼 생성 모델 평가를 실현하고, GenAI-Bench라는 새로운 벤치마크를 소개한다.

    Zhiqiu Lin, Deepak Pathak, Baiqi Li, Jiayao Li, Xide Xia

  6. #6Rewrite the Stars

    "Star operation"이 고차원 비선형 특징 공간을 생성함으로써 효율적 모델 StarNet의 성능을 향상시킨다.

    Xu Ma, Xiyang Dai, Yue Bai, Yizhou Wang, Yun Fu

  7. #7GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection

    GaLore는 LLaMA 7B 모델을 24GB GPU에서 훈련할 수 있도록 하며, 최적화 상태 메모리를 최대 65.5% 절감하는 기울기 저랭크 투영 기반 훈련 전략이다.

    Jiawei Zhao, Zhenyu (Allen) Zhang, Beidi Chen, Zhangyang Wang, Anima Anandkumar

  8. #8F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching

    F5-TTS는 ConvNeXt와 Sway Sampling을 도입한 비자기회귀 TTS 모델로, 100K시간 다국어 데이터셋에서 0.15의 RTF를 달성하고 제로샷 생성 능력을 보인다.

    Yushen Chen, Zhikang Niu, Ziyang Ma, Keqi Deng, Chunhui Wang

  9. #9MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark

    MMMU-Pro는 MMMU 벤치마크를 기반으로, 시각-언어 통합 능력을 엄격히 평가하는 새로운 멀티모달 평가 기준이다.

    Xiang Yue, Tianyu Zheng, Yuansheng Ni, Yubo Wang, Kai Zhang

  10. #10ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search

    ReST-MCTS*는 MCTS* 기반 트리 탐색을 통해 과정 보상 모델과 정책 모델을 자가 학습하는 LLM 자기 학습 프레임워크이다.

    Dan Zhang, Sining Zhoubian, Yisong Yue, Yuxiao Dong, Jie Tang

  11. #11Generative Verifiers: Reward Modeling as Next-Token Prediction

    GenRM은 생성형 검증기로, 다음 토큰 예측을 통해 LLM의 생성 능력을 활용해 검증 성능을 73% → 93.4%까지 향상시킨다.

    Lunjun Zhang, Arian Hosseini, Hritik Bansal, Mehran Kazemi, Aviral Kumar

  12. #12From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline

    BenchBuilder 파이프라인을 통해 자동화된 고질량 벤치마크 Arena-Hard-Auto를 구축하여 98.6%의 인간 선호도와 3배 높은 모델 구분력을 달성.

    Tianle Li, Wei-Lin Chiang, Evan Frick, Lisa Dunlap, Tianhao Wu

  13. #46ComBodied Agents: a New Paradigm of Human-Centric Agentic AI

    Combodied Agents는 인간의 상태와 자율성을 중심으로 한 새로운 Agentic AI 패러다임으로, 개인의 장기적 이익을 지속적으로 지원한다.

    Qianggang Ding, Xingyao Wang, Rui Feng, Zhibin Wang, Feixiang Wang

  14. #294BDH-CQ: In-Context Learning with Recurrent Latent Reasoning

    BDH-CQ는 150M 파라미터로 ARC-AGI-1에서 29.5% pass@2를 달성한, 반복적 잠재 공간 추론과 인-컨텍스트 학습을 결합한 새로운 추론 모델이다.

    Björn Engdahl, Adrian Kosowski, Jan Chorowski, Zuzanna Stamirowska, Przemysław Uznański

  15. #300RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance

    RynnValue는 7,000시간 이상의 데이터로 학습된 로봇 가치 기초 모델로, 시간 거리 기반의 보상 인터페이스를 통해 정량적 성능을 향상시킨다.

    Dongchi Huang, Hongyin Zhang, Bohan Hou, Siteng Huang, Zhian Su

  16. #301Mendel G\"odel Machine: Recursive Self-Improving Coding Agents via Comparative Evolution

    Mendel G\"odel Machine(MGM)은 비교적 신뢰성 높은 자기 개선 전략을 통해 코드 에이전트 성능을 50.8%에서 93.3%까지 향상시킨다.

    Changzhi Liu, Yilun Liu, Sikuan Yan, Volker Tresp, Yunpu Ma

  17. #307Articulated Object Reconstruction from Rest-State Observation

    Rest2Art는 단일 닫힌 상태에서 관절 구조와 3D 기하학을 복원하는 새로운 아티큘레이션 객체 재구성 프레임워크이다.

    Daeun Lee, Jaeah Lee, Woosung Kim, Haebeom Jung, Jaesik Park

  18. #308On-Policy Self-Distillation without Any Supervision

    U-OPSD는 외부 지도 없이 모델 자체의 생성물만으로 이루어지는 비지도 온-폴리시 자기-디스틸레이션 방법이다.

    Yijiang Li, Bingyang Wang, Yijun Liang, Yunjie Tian, Di Fu

  19. #309Beyond Pixels: From Video Priors to 4D Worlds

    Latent-to-4D는 VAE 공유 공간 내의 비디오 레이턴트를 직접 4D 생성에 연결하여 기존 방식의 한계를 극복한다.

    Zihao Liu, Xiaolong Shen, Zhenglin Zhou, Ruijie Quan, Yi Yang

  20. #310Scaling Inherently Interpretable Language Models

    Steerling-8B는 학습 과정에서 해석성을 명시적으로 설계한 확장 가능한 언어 모델로, 1.2트릴리온 토큰 학습 후 1500억 토큰의 미드트레이닝을 거쳐 기존 모델과 유사한 성능을 보인다.

    Guide Labs Team, Andreas Madsen, Aya Abdelsalam Ismail, Giang Nguyen, Isaac Plant

  21. #311Stealing Reasoning Traces from Proprietary LLM APIs

    프로피에터리 LLM API의 암호화 추론 흐름을 해킹하여 정보 유출 가능성을 보여준 연구.

    Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer

  22. #312Agent Memory Distillation: Empowering Small LLM Agents with Hierarchical Teacher Memory

    AMD는 GPT-5-mini의 계층적 메모리를 활용해 4B-8B 소형 모델의 정확도를 평균 27.2%p 향상시키는 훈련 없는 메모리 디스틸레이션 프레임워크다.

    Taeil Kim, Kangsan Kim, Sung Ju Hwang

  23. #313Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustness

    Decoding-Level Taboo는 생성 경로를 강제로 변경하여 LLM의 실제 세계 내구성을 진단하는 런타임 로짓 공간 개입 기법이다.

    Tadanobu Chuyo Kamijo, Ori Rottenstreich, Javier Conde, Gonzalo Martínez, Pedro Reviriego

  24. #314The Loss Does Not See the Basis, but Adam Does

    Adam 최적화기는 기저 선택에 민감해 저축도 해를 찾지 못하지만, equivariant 최적화기는 저축도 성능을 보인다.

    Devender Singh

  25. #315What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systems

    Qwen 앱에서 이미지 생성 대화에서 시각적 일관성을 유지하면서 사용자 선호를 반영한 편집 제안을 생성하기 위한 3단계 프레임워크를 제안한다.

    Zhijing Zhang, Jinpeng Yu, Xin Song, Bingnan Li, Chuyue Li

  26. #316OasisKV: Scaling In-Decode KV Cache Beyond HBM with Lookahead Sparse Prefetching

    OasisKV는 추론 시 HBM 메모리 부담을 줄이며 1.69× 이상의 처리량 향상을 달성하는 키-벨류 캐시 최적화 시스템이다.

    Can Xiao, Sukmin Cho, Junbong We, Zhixiong Niu, Jianyi Cheng

  27. #317AdvFD: Boosting Visual Generation via Adversarial Fr'echet Distance Loss

    AdvFD는 정적 특징 공간의 한계를 극복하기 위해 적대적 학습을 통한 Fréchet 거리 최적화를 제안하여 시각 생성 품질을 향상시킨다.

    Mingju Gao, Jingkai Zhou, Kun Gai, Changqian Yu, Hao Tang

  28. #318Business Arena: Benchmarking LLM Agents in a Realistic Marketplace

    Business Arena는 AI 에이전트의 실제 비즈니스 운영 능력을 평가하는 벤치마크 환경으로, 15개 모델 간 최대 9배의 자산 차이를 기록했다.

    Yijun Pan, Yukun Lian, Kunyu Shi, Junbo Li, Hongwei Xue

  29. #319VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?

    VibeLifeBench는 일상 생활 도메인에서 주도적이고 지속적인 대리인의 능력을 평가하기 위한 200개의 장기 태스크 기반 벤치마크이다.

    Xiaohongshu Inc

  30. #320A^2E : An End-to-End Agent Auditing Engine

    A²E는 대규모 언어 모델 기반 에이전트의 시스템적 평가를 위한 엔드투엔드 평가 엔진으로, ATP 프로토콜과 모니터링, 다차원 메트릭을 통해 다양한 헤이서스를 통합적으로 평가한다.

    Haoning Wang, Mingxun Zhang, Chenyue Yu, Yingjun Shang, Xia Hu

인기 키워드

reinforcement-learning (331) diffusion-models (190) llm (190) llm-agents (160) video-generation (129) transformer (126) llm-evaluation (125) vision-language (112) vlm (109) long-context (99) large-language-models (94) code-generation (88) long-horizon (86) benchmark-evaluation (82) benchmarking (80) language-models (75) retrieval-augmented (73) flow-matching (68) world-models (68) foundation-models (67)