HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-09-11 featured 논문 30편

  1. #1Programmable World Model

    Programmable World Model은 자연어를 기반으로 세계 상태를 명시적으로 관리하고 생성하는 시스템으로, 94%의 Count Accuracy와 98%의 State Accuracy를 달성한다.

    Zheng-Hui Huang, Guixu Lin, Jiacheng Lin, Yi-Chuan Huang, Ruihan Yu

  2. #2DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments

    DeepResearcher는 실제 웹 환경에서 강화학습을 확장하여 LLM 기반 연구 에이전트를 훈련하는 최초의 종단간 프레임워크로, 기존 방법 대비 최대 28.9점의 성능 향상을 보인다.

    Yuxiang Zheng, Dayuan Fu, Xiangkun Hu, Xiaojie Cai, Lyumanshan Ye

  3. #3Monitoring AI-Modified Content at Scale: A Case Study on the Impact of ChatGPT on AI Conference Peer Reviews

    AI 생성 텍스트의 대규모 모니터링을 위한 최대우도 기반 추정 모델을 제안하고, AI 학회 리뷰 데이터를 통해 6.5~16.9%의 텍스트가 LLM에 의해 수정되었을 가능성을 분석한다.

    Weixin Liang, Zachary Izzo, Yaohui Zhang, Haley Lepp, Hancheng Cao

  4. #4Many-Shot In-Context Learning

    Gemini 1.5 Pro를 활용해 수천~수만 샷의 Many-Shot ICL을 실험하고, Reinforced 및 Unsupervised ICL을 제안하여 인간 라벨 의존도를 줄인다.

    Rishabh Agarwal, Avi Singh, Lei M. Zhang, Bernd Bohnet, Stephanie Chan

  5. #5Improving Video Generation with Human Feedback

    182,000개의 인간 선호 데이터를 기반으로 Flow-DPO, Flow-RWR, Flow-NRG를 도입해 비디오 생성 모델의 정렬을 개선한다.

    Jie Liu, Gongye Liu, Jiajun Liang, Ziyang Yuan, Xiaokun Liu

  6. #6Data Interpreter: An LLM Agent For Data Science

    Data Interpreter는 데이터 과학 문제를 종단간 해결하는 LLM 에이전트로, 계층적 그래프 모델링과 프로그래밍 가능한 노드 생성을 통해 25% 이상의 성능 향상을 달성했다.

    Sirui Hong, Yizhang Lin, Bangbang Liu, Binhao Wu, Danyang Li

  7. #7Training Software Engineering Agents and Verifiers with SWE-Gym

    SWE-Gym을 활용한 소프트웨어 엔지니어링 에이전트 학습 환경 구축과 32.0% 성능 달성.

    Jiayi Pan, Xingyao Wang, Graham Neubig, N. Jaitly, Heng Ji

  8. #8AlphaEdit: Null-Space Constrained Knowledge Editing for Language Models

    AlphaEdit는 기존 지식을 유지하면서 LLM 편집 성능을 평균 36.7% 향상시키는 null-space 기반 편집 방법이다.

    Junfeng Fang, Houcheng Jiang, Kun Wang, Yunshan Ma, Xiang Wang

  9. #9Video Depth Anything: Consistent Depth Estimation for Super-Long Videos

    Video Depth Anything는 초장시간 동영상에서도 깊이 추정의 일관성을 유지하면서 계산 효율성을 보장하는 모델이다.

    Sili Chen, Hengkai Guo, Shengnan Zhu, Feihu Zhang, Zilong Huang

  10. #10MUSE: Machine Unlearning Six-Way Evaluation for Language Models

    MUSE는 언어 모델에서 데이터 제거 효과를 6가지 기준으로 평가하는 벤치마크로, 기존 알고리즘의 한계를 드러냄.

    Weijia Shi, Jaechan Lee, Yangsibo Huang, Sadhika Malladi, Jieyu Zhao

  11. #11Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning

    PAV(Progress Advantage Verifier)를 사용한 프로세스 보상 최적화가 테스트 타임 검색과 온라인 RL에서 정확도와 계산 효율성을 동시에 향상시킨다.

    Amrith Rajagopal Setlur, Chirag Nagpal, Adam Fisch, Xinyang Geng, Jacob Eisenstein

  12. #284Show-Harness: Just a VLM Agent Can Play Robots

    Show-Harness는 VLM을 통해 로봇을 제어할 수 있는 세마틱 인터페이스를 제공하여, 제로샷 및 저비용 배포가 가능하다.

    Yanzhe Chen, Zechen Bai, Zhijun Cao, Wenzheng Zeng, Kevin Qinghong Lin

  13. #294OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining

    OpenWAM은 모듈화된 연구 스택을 통해 시스템적인 월드-액션 모델 사전학습을 구현한 오픈 프레임워크이다.

    Yuran Wang, Siqiao Huang, Mingleyang Li, Chenhao Zhang, Jiaqi Liang

  14. #299Physics-informed neural networks by Gradient-Guided Gaussian Adaptive Sampling (3GAS-PINNs)

    Yousen Wang, Wei Zhao

  15. #305Measuring Language Transfer in Robot Policies: Adding Greek to a Cosmos3 Vision-Language-Action Policy

    로봇 정책에 그리스어를 추가할 때, 번역된 데이터만 사용해도 성능이 일부 개선되지만, 정확한 측정이 핵심 과제임을 밝혔다.

    Ayoub Kirouane, Georgios Giaples, Christos Petrocheilos

  16. #306AgenticGen: Reward-Guided Agentic Video Generation for Advertising

    Xingyuan Bu, Chengru Song, Hao Zhou, Tao Zhou, Dong Li

  17. #307SyncWorld: Visual Calibration Enables World Models as Zero-Shot Simulators

    SyncWorld는 시각 교정을 통해 학습된 액션-시각 매핑을 기반으로, 추가 학습 없이 새로운 환경에서 제로샷 시뮬레이션을 수행하는 월드 모델이다.

    Yuncong Yang, Zhengtao Han, Furkan Ozyurt, Zeyuan Yang, Han Yang

  18. #308Valerant: An Automatic Navigable Game Map Generator via Action-Conditioned World Model Exploration

    Yiran Qiao, Feng Wang, Jing Ma

  19. #309From State Synchronization to Cognitive Self-Evolution: An Operational Architecture for Cognitive Digital Twins

    4단계 CDT 아키텍처를 제안하여 인지 기능을 체계적으로 통합하고, 운영 효율성을 향상시킨다.

    Haoran Gao, An Li, Zhen Li, Jun Cai

  20. #310Seven Sources of Physical AI Capability Formation

    Gang Chen

  21. #311AgentGrad: Intervention-guided Prompt Optimization for Multi Agent Systems

    AgentGrad는 순차적 개입과 의미론적 텍스트 그라디언트 추상화를 통해 다중 에이전트 시스템의 프롬프트 최적화 성능을 2.5배 빠르게 개선하는 프레임워크다.

    Jaewon Chu, Jinwoo Seo, Jaewon Cho, Jeehye Na, Yunyang Xiong

  22. #312Marigold V2: Revisiting Diffusion Transformers for Monocular Depth Estimation

    Marigold V2는 Qwen-Image-Edit를 기반으로 2단계 학습 프로토콜을 통해 단일 이미지에서 고해상도 깊이 맵을 생성하는 확산 변형기 기반 모델로, KITTI와 ETH3D에서 AbsRel 기준 16-26% 개선된 성능을 보인다.

    Igor Pavlovic, Thiemo Wandel, Anton Obukhov, Luca Bartolomei, Andrey Davydov

  23. #313StochBench: A Domain-Specific Benchmark for Stochastic Processes in Lean

    StochBench는 Lean 4 기반의 확률과정 분야 대학원 수준 정리 450개를 포함한 도메인별 정리 증명 벤치마크로, Opus 4.8 기반 에이전트가 15분 제한 내 34.9% 증명 성공.

    Idan Davidovich, Debargha Ganguly, Vikash Singh, Vipin Chaudhary

  24. #314Train Smarter, Not Harder: Switching Signal-Guided Training in Active Learning

    HybridAL은 모델 경로의 안정화를 감지하여 재학습과 미세조정을 적응적으로 전환하는 활성 학습 전략으로, 49%의 시간 절약과 NLL 기반 교정 개선을 달성한다.

    Nagham Omar, Maya Rozenshtein, Evgeny Mishlyakov, Avigdor Gal

  25. #315VDiff-Bench: A Challenging Benchmark for Fine-Grained Image Difference Identification

    VDiff-Bench는 MLLMs의 미세한 시각적 차이 인식 능력을 평가하기 위한 다중 선택형 벤치마크로, 10개의 변화 범주와 1,756개의 질문을 포함한다.

    Yixin Wan, Tianle Zheng, Kai-Wei Chang

  26. #316RESCUE-BENCH: Towards Relation-Aware Multi-Party Emotional Support Conversation Systems

    Haichuan Hu, Yang Xiao, Mingni Tang, Jiawen Duan, Quanjun Zhang

  27. #317WearableQA: A Benchmark for Health Reasoning over Real-World Wearable Data

    WearableQA는 200명의 실제 사용자 데이터를 기반으로 건강 추론 능력을 평가하는 4,084개의 다중 선택형 질문을 포함한 새로운 벤치마크이다.

    Ji Soo Lee, Xilun Chen, Pierce Chuang, Ashish Shenoy, Jason Wei

  28. #318What Did I Just Say? Self-Listening for Full-Duplex Speech Models

    Xuanning Zhou, Junyi Ao, Xiaotong Liu, Tom Ko, Benyou Wang

  29. #319SWE-Bench Pro Verified: A Reliable Benchmark for Software Engineering Agents

    SWE-Bench Pro Verified는 기존 SWE-Bench Pro의 신뢰도 문제를 해결한 소프트웨어 엔지니어링 에이전트 평가 벤치마크이다.

    Pujun Zheng, Zixin Shang, Shufan Jiang, Wenhui Tian, Dongsheng Zhu

  30. #320SAEScientist-Bench: Can AI Agents Conduct Autonomous SAE Interpretability Research?

    AI 에이전트가 SAE 도구를 활용해 자율적으로 모델 해석 연구를 수행할 수 있는지 평가하는 벤치마크인 SAEScientist-Bench를 제안한다.

    Yuqiao Tan, Shizhu He, Jun Zhao, Kang Liu

인기 키워드

reinforcement-learning (344) diffusion-models (199) llm (197) llm-agents (163) video-generation (136) llm-evaluation (134) transformer (130) vision-language (121) vlm (109) long-context (103) large-language-models (99) code-generation (96) long-horizon (89) benchmark-evaluation (86) benchmarking (84) language-models (79) retrieval-augmented (77) flow-matching (70) world-models (70) foundation-models (69)