HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-08-14 featured 논문 30편

  1. #1Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill

    Spark-to-Paper는 기존 코드 어시스턴트 내에서 13개의 구성 가능한 스킬을 통해 연구 아이디어를 종단간 논문으로 생성하는 시스템이다.

    Zhuoyang Qian, Biao Wu, Yiran Wang, Chris D Yan, Desan Dai

  2. #2Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model

    Open-Reasoner-Zero는 Qwen2.5-32B 기반 모델에 PPO와 GAE를 적용해 1/10의 학습 스텝으로 AIME2024, MATH500, GPQA Diamond에서 DeepSeek-R1-Zero를 상회하는 성능을 달성한 오픈소스 RL 구현이다.

    Jingcheng Hu, Yinmin Zhang, Qi Han, Daxin Jiang, Xiangyu Zhang

  3. #3Mean Flows for One-step Generative Modeling

    MeanFlow는 1-NFE로 ImageNet 256x256에서 FID 3.43를 달성한 원스텝 생성 모델링 프레임워크다.

    Zhengyang Geng, Mingyang Deng, Xingjian Bai, Zico Kolter, Kaiming He

  4. #4Why Do Multi-Agent LLM Systems Fail?

    다중 에이전트 LLM 시스템(MAS) 실패 원인을 체계적으로 분석한 실험적 실패 분류체계(MAST)와 대규모 데이터셋(MAST-Data)를 제시한다.

    M. Cemri, Melissa Z. Pan, Shuyi Yang, Lakshya A. Agrawal, Bhavya Chopra

  5. #5The WMDP Benchmark: Measuring and Reducing Malicious Use With Unlearning

    WMDP 벤치마크와 RMU 방법을 통해 대형 언어 모델의 악용 가능 지식을 평가하고 제거하는 기술적 접근을 제시한다.

    Nathaniel Li, Alexander Pan, Anjali Gopal, Summer Yue, Daniel Berrios

  6. #6Contrastive Preference Optimization: Pushing the Boundaries of LLM Performance in Machine Translation

    13B 규모의 ALMA 모델에 Contrastive Preference Optimization(CPO)를 적용해 GPT-4와 WMT 우승 모델과 유사한 번역 성능 달성.

    Haoran Xu, Amr Sharaf, Yunmo Chen, Weiting Tan, Lingfeng Shen

  7. #7Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models

    Prometheus 2는 직접 평가와 순위 평가 모두에서 GPT-4 수준의 성능을 보이는 오픈소스 평가 언어 모델이다.

    Seungone Kim, Juyoung Suk, Shayne Longpre, Bill Yuchen Lin, Jamin Shin

  8. #8ComBodied Agents: a New Paradigm of Human-Centric Agentic AI

    Combodied Agents는 인간의 상태와 자율성을 중심으로 한 새로운 Agentic AI 패러다임으로, 개인의 장기적 이익을 지속적으로 지원한다.

    Qianggang Ding, Xingyao Wang, Rui Feng, Zhibin Wang, Feixiang Wang

  9. #9TimeXer: Empowering Transformers for Time Series Forecasting with Exogenous Variables

    TimeXer는 외부 변수를 효과적으로 통합하여 Transformer 기반 시계열 예측 성능을 향상시키는 새로운 모델이다.

    Yuxuan Wang, Haixu Wu, Jiaxiang Dong, Yong Liu, Yunzhong Qiu

  10. #10Poly Kernel Inception Network for Remote Sensing Detection

    PKINet은 다중 스케일 커널과 CAA 모듈을 결합하여 원격 감지 이미지의 객체 탐지 성능을 향상시킨다.

    Xinhao Cai, Qiuxia Lai, Yuwei Wang, Wenguan Wang, Zeren Sun

  11. #11Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion

    Self Forcing은 자동회귀 비디오 디퓨전 모델의 트레인-테스트 갭을 해소하는 새로운 훈련 패러다임으로, 실시간 스트리밍 생성을 가능하게 한다.

    Xun Huang, Zhengqi Li, Guande He, Mingyuan Zhou, Eli Shechtman

  12. #12WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

    WildGuard는 LLM 안전성 모니터링을 위한 다중 작업 오픈 소스 도구로, 13개 위험 범주에서 뛰어난 성능을 보인다.

    Seungju Han, Kavel Rao, Allyson Ettinger, Liwei Jiang, Bill Yuchen Lin

  13. #298SkillZip: Contract-Preserving Graph Compression for Scalable Agent Skill Libraries

    SkillZip은 실행 계약을 보존하면서 실행 그래프를 압축하는 스케일러블 에이전트 스킬 라이브러리 시스템이다.

    Xingyu Tan, Xiaoyang Wang, Qing Liu, Xiwei Xu, Xin Yuan

  14. #304Articulated Object Reconstruction from Rest-State Observation

    Rest2Art는 단일 닫힌 상태에서 관절 구조와 3D 기하학을 복원하는 새로운 아티큘레이션 객체 재구성 프레임워크이다.

    Daeun Lee, Jaeah Lee, Woosung Kim, Haebeom Jung, Jaesik Park

  15. #305Beyond Pixels: From Video Priors to 4D Worlds

    Latent-to-4D는 VAE 공유 공간 내의 비디오 레이턴트를 직접 4D 생성에 연결하여 기존 방식의 한계를 극복한다.

    Zihao Liu, Xiaolong Shen, Zhenglin Zhou, Ruijie Quan, Yi Yang

  16. #306OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution

    OpenART는 복잡하고 진화하는 환경에서 에이전트 안전성을 평가하기 위한 대규모 레드팀 테스트 플랫폼으로, 환경 진화를 통해 85.0%의 공격 성공률을 달성한다.

    Yunhao Chen, Xin Wang, Yixu Wang, Yi Liu, Jie Li

  17. #307Self-Evolving Embodied Agents via Skill-Harness Evolution

    SHAPER는 모델 파라미터를 고정한 채, 재사용 가능한 스킬과 컨텍스트-코드 헤이버스를 진화시켜 자율적으로 적응하는 임베디드 에이전트를 구현하는 프레임워크이다.

    Peidong Wang, Zhiming Ma, Ying Chang, Xufang Luo, Xiaocui Yang

  18. #308Co-Evolution in Agentic Systems: Toward Self-Directed Evolution Beyond Human Design

    본 논문은 에이전트 시스템에서의 공동진화(co-evolution)를 다층적 세 단계 분류로 체계화하고, 인간 설계를 벗어난 자기 주도적 진화의 가능성을 탐색한다.

    Qing Zong, Jiayu Liu, Junhao Shen, Zecong Tang, Linsi Wu

  19. #309From Synthesis to Removal: Physics-Grounded Reflection Simulation and Diffusion-Based Video Dereflection

    유리 표면 반사 제거를 위한 물리 기반 시뮬레이션과 확산 모델 기반 비디오 반사 제거 프레임워크를 제안한다.

    Zepeng Wang, Jiagao Hu, Fuhao Li, Yuxuan Chen, Fei Wang

  20. #310AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses

    강력한 모델이 추론 시점에서 약한 모델의 성능을 0.49에서 0.91로 향상시키는 추론 환경 설계 방법을 제안한다.

    Cheng Qian, Wenting Zhao, Liangwei Yang, Heng Wang, Jielin Qiu

  21. #311Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustness

    Decoding-Level Taboo는 생성 경로를 강제로 변경하여 LLM의 실제 세계 내구성을 진단하는 런타임 로짓 공간 개입 기법이다.

    Tadanobu Chuyo Kamijo, Ori Rottenstreich, Javier Conde, Gonzalo Martínez, Pedro Reviriego

  22. #312Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence

    Mechanist는 AI 모델의 작동 메커니즘을 자동으로 탐색하는 시스템으로, 13,000개 논문 기반 지식그래프와 32개 메커니즘 해석 방법을 활용한다.

    Mengru Wang, Junfeng Fang, Shuofei Qiao, Zhenqian Xu, Haoming Xu

  23. #313AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models

    AtlasVLA는 단일 워리스트 카메라로 장기적 작업을 수행하는 데 있어 지속적 세계-자기 상태를 모델링하여 기존 VLA 모델의 한계를 극복한 새로운 프레임워크이다.

    Guiyu Zhao, Longteng Guo, Yanghong Mei, Zilin Zhu, Yu Zhang

  24. #314Federated Learning for Distributed CNC Tool Wear Prediction

    분산된 CNC 공작기계 데이터 환경에서 툴 마모 예측을 위한 연방학습 프레임워크를 제안하고 MATWI 데이터셋을 기반으로 성능 검증.

    Afsana Khan, Morris Stallmann, Marcin Pietrasik, Charis Kouzinopoulos, Anna Wilbik

  25. #315Hand Visibility Detector: Per-Keypoint Visibility Estimation for Hands

    손 관절별 가시성 추정을 위한 독립적 모델인 Hand Visibility Detector를 제안하고, 3D 손 포즈 추정에서 재투영 오류 감소를 실증적으로 보인다.

    Ryosei Hara, Masashi Hatano, Rintaro Yanagi, Atsushi Hashimoto, Takuma Yagi

  26. #316AutoWorldModel-Bench: A State-Centric Benchmark for Automated World-Model Research

    AutoWorldModel-Bench는 8개 게임 환경에서 AI 코드 에이전트가 세계 모델을 자율적으로 개선하는 데 사용되는 폐쇄 루프 벤치마크이다.

    Marjan Moodi, Xuankang Zhu, Fernando De Mesentier Silva, Harold Chaput, Mohammad Reza Taesiri

  27. #317Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives

    LLM 에이전트가 장기적 스토리 일관성을 유지하는지 평가하는 NCP-Bench 벤치마크를 제안하며, GPT-5.2 포함 주요 모델이 40~68%의 사실 충돌률을 보임.

    Yingpeng Ma, Jianhao Yan, Bei Shi, Ka Hou Kam, Runnan Wang

  28. #318Mendel G\"odel Machine: Recursive Self-Improving Coding Agents via Comparative Evolution

    Mendel G\"odel Machine(MGM)은 비교적 신뢰성 높은 자기 개선 전략을 통해 코드 에이전트 성능을 50.8%에서 93.3%까지 향상시킨다.

    Changzhi Liu, Yilun Liu, Sikuan Yan, Volker Tresp, Yunpu Ma

  29. #319AdvFD: Boosting Visual Generation via Adversarial Fr'echet Distance Loss

    AdvFD는 정적 특징 공간의 한계를 극복하기 위해 적대적 학습을 통한 Fréchet 거리 최적화를 제안하여 시각 생성 품질을 향상시킨다.

    Mingju Gao, Jingkai Zhou, Kun Gai, Changqian Yu, Hao Tang

  30. #320StateFlow: Building, Evolving, and Accessing 3D World States for Previsualization

    StateFlow는 편집 가능한 3D 월드 상태를 기반으로 프리비주얼라이제이션을 구축하고 진화시키는 상태 중심 프레임워크이다.

    Yuyang Yin, Zixiang Li, Longxuan Deng, Hongkai Li, Shifang Zhao

인기 키워드

reinforcement-learning (331) diffusion-models (190) llm (190) llm-agents (160) video-generation (129) transformer (126) llm-evaluation (125) vision-language (112) vlm (109) long-context (99) large-language-models (94) code-generation (88) long-horizon (86) benchmark-evaluation (82) benchmarking (80) language-models (75) retrieval-augmented (73) flow-matching (68) world-models (68) foundation-models (67)