HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-09-12 featured 논문 30편

  1. #1NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction

    NCP-ArchPreview는 개념 수준 예측을 도입한 대규모 잠재공간 언어 모델로, 기존 토큰 예측 기반 모델보다 높은 성능을 보인다.

    The Intern-NCP Team, :, Jiaqi Cao, Chiyu Chen, Shuang Cheng

  2. #2AutoWebGLM: A Large Language Model-based Web Navigating Agent

    AutoWebGLM은 HTML 단순화 알고리즘과 강화학습을 결합한 웹 탐색 에이전트로, GPT-4를 능가하며 AutoWebBench에서 뛰어난 성능을 보인다.

    Hanyu Lai, Xiao Liu, Iat Long Iong, Shuntian Yao, Yuxuan Chen

  3. #3Sundial: A Family of Highly Capable Time Series Foundation Models

    Sundial은 TimeFlow Loss를 도입한 확장성 높은 시계열 생성 모델로, 1조 개의 시계열 포인트로 사전 학습되어 최신 성능을 달성한다.

    Yong Liu, Guo Qin, Zhiyuan Shi, Zhi Chen, Caiyi Yang

  4. #4Scaling Automatic Research Agents via World Models

    WMRL은 AutoResearch 에이전트의 RL 학습을 3–4× 가속화하면서 성능을 향상시키는 세계 모델 기반 접근법이다.

    Xiyuan Yang, Sheikh Sarwar, Jingru Cheng, Zhan Shi, Duanshun Li

  5. #5GenAD: Generative End-to-End Autonomous Driving

    GenAD는 생성 모델링 기반의 end-to-end 자율주행 프레임워크로, nuScenes 벤치마크에서 최고 성능을 달성한다.

    Wenzhao Zheng, Ruiqi Song, Xianda Guo, Long Chen

  6. #6Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction

    Aguvis는 화면 이미지 기반의 통합 GUI 에이전트로, Qwen2-VL과 2D-RoPE를 활용해 플랫폼 간 호환성과 추론 능력을 향상시킨다.

    Yiheng Xu, Zekun Wang, Junli Wang, Dunjie Lu, Tianbao Xie

  7. #7Scaling Diffusion Language Models via Adaptation from Autoregressive Models

    GPT2와 LLaMA를 기반으로 확장된 DiffuGPT와 DiffuLLaMA는 200B 토큰 미만으로 훈련되어 기존 DLM을 능가하고 AR 모델과 경쟁한다.

    Shansan Gong, Shivam Agarwal, Yizhe Zhang, Jiacheng Ye, Lin Zheng

  8. #8Diffusion-TS: Interpretable Diffusion for General Time Series Generation

    Diffusion-TS는 시계열 생성의 해석성과 현실성을 동시에 달성하는 디퓨전 모델 기반 프레임워크이다.

    Xinyu Yuan, Yan Qiao

  9. #9Automated Design of Agentic Systems

    Meta Agent Search를 통해 코드 공간에서 자동으로 설계된 에이전트 시스템이 기존 수작업 에이전트를 크게 초과함.

    Shengran Hu, Cong Lu, Jeff Clune

  10. #10AppWorld: A Controllable World of Apps and People for Benchmarking Interactive Coding Agents

    AppWorld는 일상 디지털 작업 자동화를 위한 대규모 API 기반 인터랙티브 코딩 에이전트 벤치마크 및 실행 환경을 제공한다.

    H. Trivedi, Tushar Khot, Mareike Hartmann, R. Manku, Vinty Dong

  11. #11Show-o2: Improved Native Unified Multimodal Models

    Show-o2는 3D 인과 VAE와 자동회귀 모델링, 플로우 매칭을 결합한 네이티브 통합 멀티모달 모델로, 이미지와 동영상 처리에서 우수한 성능을 보인다.

    Jinheng Xie, Zhenheng Yang, M. Shou

  12. #12BrushNet: A Plug-and-Play Image Inpainting Model with Decomposed Dual-Branch Diffusion

    BrushNet은 기존 디퓨전 모델에 플러그 앤 플레이 방식으로 결합 가능한 듀얼-브랜치 디퓨전 모델로, 이미지 인페인팅 성능을 7개 메트릭에서 개선한다.

    Xu Ju, Xian Liu, Xintao Wang, Yuxuan Bian, Ying Shan

  13. #302SpatialBlock: Enhancing Spatial Intelligence in LVLMs via Synthetic Block-Stacking Problem

    SpatialBlock-15k라는 합성 블록 쌓기 데이터셋을 통해 LVLM의 공간 지능을 향상시키는 새로운 학습 패러다임을 제안한다.

    Soohyun Ryu, Sohee Kim, Eunho Yang

  14. #304Mi-Ripple: Restoring Images Degraded by Iterative AI Editing

    Mi-Ripple은 반복적인 AI 이미지 편집으로 생긴 디지털 릴리프를 진단 기반으로 복원하는 워크플로우다.

    Jiayin Chen, Yicheng Xu, Muting Wang

  15. #305SenseNova-U1.5: Towards Native Unified Visual Intelligence

    SenseNova-U1.5는 8B-MoT 아키텍처를 기반으로, 인코더 및 VAE 없이 시각 이해, 추론, 생성을 통합한 4K 해상도까지 지원하는 네이티브 통합 시각 지능 모델이다.

    Haiwen Diao, Jiahao Wang, Chenjing Ding, Hanming Deng, Jiangnan Chen

  16. #306AgentGrad: Intervention-guided Prompt Optimization for Multi Agent Systems

    AgentGrad는 순차적 개입과 의미론적 텍스트 그라디언트 추상화를 통해 다중 에이전트 시스템의 프롬프트 최적화 성능을 2.5배 빠르게 개선하는 프레임워크다.

    Jaewon Chu, Jinwoo Seo, Jaewon Cho, Jeehye Na, Yunyang Xiong

  17. #307SyncWorld: Visual Calibration Enables World Models as Zero-Shot Simulators

    SyncWorld는 시각 교정을 통해 학습된 액션-시각 매핑을 기반으로, 추가 학습 없이 새로운 환경에서 제로샷 시뮬레이션을 수행하는 월드 모델이다.

    Yuncong Yang, Zhengtao Han, Furkan Ozyurt, Zeyuan Yang, Han Yang

  18. #308Memory as Plans: World-Action Modeling with Memory-Grounded Planning

    MaP-WAM은 장기 기억 기반 계획과 실행을 분리하여 RMBench에서 83.3% 성공률을 달성한 로봇 제어 프레임워크이다.

    Sizhe Zhao, Haozhe Xie, Weiyu Zhao, Chenchu Zhang, Huan Wang

  19. #309Valerant: An Automatic Navigable Game Map Generator via Action-Conditioned World Model Exploration

    Valerant는 3D 게임 맵을 자동 생성하는 훈련 없이 작동하는 프레임워크로, 예측된 시각 정보와 SLAM 기반 재구성을 결합한다.

    Yiran Qiao, Feng Wang, Jing Ma

  20. #310From State Synchronization to Cognitive Self-Evolution: An Operational Architecture for Cognitive Digital Twins

    4단계 CDT 아키텍처를 제안하여 인지 기능을 체계적으로 통합하고, 운영 효율성을 향상시킨다.

    Haoran Gao, An Li, Zhen Li, Jun Cai

  21. #311Seven Sources of Physical AI Capability Formation

    물리적 AI의 능력 형성 원인을 7가지 독립적 출처로 분류하고 이론적 포화를 달성한 연구.

    Gang Chen

  22. #312Processing and classifying bird songs using wavelet techniques and supervised learning

    고음질 환경 소음 속 조류 소리 분류를 위해 베이지안 웨이블릿 기법과 SVM 분류기 결합한 통합 프레임워크를 제안한다.

    Laura Lucia Dominguez Barrios, Fidel Aniano Causil Barrios, Alex Rodrigo dos Santos Sousa, Mariana Rodrigues Motta

  23. #313Train Smarter, Not Harder: Switching Signal-Guided Training in Active Learning

    HybridAL은 모델 경로의 안정화를 감지하여 재학습과 미세조정을 적응적으로 전환하는 활성 학습 전략으로, 49%의 시간 절약과 NLL 기반 교정 개선을 달성한다.

    Nagham Omar, Maya Rozenshtein, Evgeny Mishlyakov, Avigdor Gal

  24. #314T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks

    T1은 122B Mixture-of-Experts 모델로, 300+ 툴 호출을 처리하며 강화 학습을 통해 터미널 작업 성능을 64.0%까지 향상시킨다.

    Junyao Yang, Yucheng Shi, Zhongzhi Li, Ruhan Wang, Zongxia Li

  25. #315EvoSafeHarness: Evolving Model- and Domain-Specific Harnesses for Securing Agents

    EvoSafeHarness는 모델과 도메인에 맞춘 안전성 햬스를 진화적으로 생성하여, 기존 정적 햬스 대비 안전성-유틸리티 균형을 개선한다.

    Nanxi Li, Yingzi Ma, Yulong Cao, Edward Suh, Bo Li

  26. #316WearableQA: A Benchmark for Health Reasoning over Real-World Wearable Data

    WearableQA는 200명의 실제 사용자 데이터를 기반으로 건강 추론 능력을 평가하는 4,084개의 다중 선택형 질문을 포함한 새로운 벤치마크이다.

    Ji Soo Lee, Xilun Chen, Pierce Chuang, Ashish Shenoy, Jason Wei

  27. #317RESCUE-BENCH: Towards Relation-Aware Multi-Party Emotional Support Conversation Systems

    RESCUE-Bench는 대규모 언어 모델이 다자간 감정 지원 대화에서 관계를 이해하고 활용하는 능력을 평가하는 새로운 벤치마크이다.

    Haichuan Hu, Yang Xiao, Mingni Tang, Jiawen Duan, Quanjun Zhang

  28. #318SWE-Bench Pro Verified: A Reliable Benchmark for Software Engineering Agents

    SWE-Bench Pro Verified는 기존 SWE-Bench Pro의 신뢰도 문제를 해결한 소프트웨어 엔지니어링 에이전트 평가 벤치마크이다.

    Pujun Zheng, Zixin Shang, Shufan Jiang, Wenhui Tian, Dongsheng Zhu

  29. #319PARSER: Read in Parallel, Reason in Depth for Long-Context LLM Agents

    PARSER는 긴 문서를 병렬로 읽고 추론을 반복적으로 수행하여, 기존 순차 메모리 기반 모델 대비 정확도와 추론 속도를 동시에 개선한 LLM 에이전트 구조이다.

    Kun Li, Zexuan Qiu, Tianhua Zhang, Irwin King, Helen Meng

  30. #320SAEScientist-Bench: Can AI Agents Conduct Autonomous SAE Interpretability Research?

    AI 에이전트가 SAE 도구를 활용해 자율적으로 모델 해석 연구를 수행할 수 있는지 평가하는 벤치마크인 SAEScientist-Bench를 제안한다.

    Yuqiao Tan, Shizhu He, Jun Zhao, Kang Liu

인기 키워드

reinforcement-learning (347) diffusion-models (202) llm (198) llm-agents (165) video-generation (137) llm-evaluation (136) transformer (132) vision-language (124) vlm (109) long-context (104) large-language-models (100) code-generation (98) long-horizon (90) benchmark-evaluation (88) benchmarking (85) language-models (79) retrieval-augmented (77) flow-matching (72) foundation-models (71) world-models (71)