HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-08-15 featured 논문 30편

  1. #1DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation

    DreamX-Phi 1.0은 언어 지시와 로봇 동작을 조건으로 미래 장면을 예측하는 조건부 영상 월드 모델로, WorldArena 2.0에서 Track 1 1위, Track 2 2위를 달성했다.

    DreamX Team, Rui Chen, Xiangxiang Chu, Geng Li, Jifan Li

  2. #2MambaAD: Exploring State Space Models for Multi-class Unsupervised Anomaly Detection

    MambaAD는 Mamba 기반 디코더와 LSS 모듈을 결합해 다중 클래스 비지도 이상 탐지에서 최첨단 성능을 달성한 모델이다.

    Haoyang He, Yuhu Bai, Jiangning Zhang, Qingdong He, Hongxu Chen

  3. #3H2R-Bench: Benchmarking Human-to-Robot Manipulation Video Generation in World Models

    H2R-Bench는 인간 조작 영상을 로봇 중심 조작 영상으로 전환하는 능력을 평가하는 벤치마크로, 6개 조작 유형과 2개 로봇 구조에서 11개 모델을 평가한다.

    Dingyi Rong, Yue Shi, Chaofan Ma, Jiezhang Cao, Zongrui Wang

  4. #4MambaVision: A Hybrid Mamba-Transformer Vision Backbone

    MambaVision은 시각 작업에 최적화된 하이브리드 Mamba-Transformer 백본으로, ImageNet-1K에서 최신 성능을 달성한다.

    Ali Hatamizadeh, Jan Kautz

  5. #5Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention

    NSA는 하드웨어 최적화와 끝에서 끝까지 학습 가능한 희소 어텐션 구조를 통해 64k 길이의 시퀀스에서 1.6× 이상 가속화된 효율적인 롱컨텍스트 모델링을 실현한다.

    Jingyang Yuan, Huazuo Gao, Damai Dai, Junyu Luo, Liang Zhao

  6. #6CAT3D: Create Anything in 3D with Multi-View Diffusion Models

    CAT3D는 멀티뷰 디퓨전 모델을 활용해 3D 장면을 1분 이내에 생성하는 시스템으로, 단일 이미지나 텍스트 입력에서도 높은 일관성을 보인다.

    Ruiqi Gao, Aleksander Holynski, Philipp Henzler, Arthur Brussee, Ricardo Martin-Brualla

  7. #7UniDepth: Universal Monocular Metric Depth Estimation

    UniDepth는 단일 이미지로 도메인 간 메트릭 3D 깊이를 추정하는 최초의 유니버설 모델로, 10개 데이터셋에서 제로샷 성능을 기록했다.

    Luigi Piccinelli, Yung-Hsu Yang, Christos Sakaridis, Mattia Segu, Siyuan Li

  8. #8Video-R1: Reinforcing Video Reasoning in MLLMs

    Video-R1은 MLLM에서 비디오 추론 능력을 강화하기 위해 T-GRPO 알고리즘과 Video-R1-260k 데이터셋을 도입한 첫 시스템적 연구이다.

    Kaituo Feng, Kaixiong Gong, Bohao Li, Zonghao Guo, Yibing Wang

  9. #9Mixture-of-Agents Enhances Large Language Model Capabilities

    다중 대형 언어 모델(LLM)의 협업을 통해 생성 품질을 향상시키는 Mixture-of-Agents(MoA) 프레임워크를 제안하고, AlpacaEval 2.0에서 65.1%의 성능을 달성한다.

    Junlin Wang, Jue Wang, Ben Athiwaratkun, Ce Zhang, James Zou

  10. #10Safety Alignment Should Be Made More Than Just a Few Tokens Deep

    현재 대형 언어 모델의 안전 정렬은 첫 몇 개의 토큰만 고려하는 "얕은 안전 정렬"로 인해 취약하다.

    Xiangyu Qi, Ashwinee Panda, Kaifeng Lyu, Xiao Ma, Subhrajit Roy

  11. #11ShareGPT4Video: Improving Video Understanding and Generation with Better Captions

    ShareGPT4Video는 GPT4V와 자체 개발된 Differential Sliding-Window Captioning을 기반으로 40K 고질량 영상-캡션 데이터와 4.8M 캡션을 생성하여 영상 이해 및 생성 모델 성능을 향상시킨다.

    Lin Chen, Xilin Wei, Jinsong Li, Xiao-wen Dong, Pan Zhang

  12. #12InjecAgent: Benchmarking Indirect Prompt Injections in Tool-Integrated Large Language Model Agents

    InjecAgent는 도구 통합 대형 언어 모델 에이전트의 간접 프롬프트 주입 취약성을 평가하는 벤치마크로, GPT-4 기반 ReAct 프롬프트 에이전트가 24%의 공격 성공률을 보임.

    Qiusi Zhan, Zhixiang Liang, Zifan Ying, Daniel Kang

  13. #295Alaya-EVOKE: From Linear-Scaling Supervision to Endless World

    Evoke는 지속적 세계 상태를 외부 기하 메모리에 분리하고, 선형 확장의 지도를 통해 3단계 생성자로 장기적 상호작용을 가능하게 하는 세계 모델이다.

    Yuanyang Yin, Gongxuan Wang, Yifan Zhan, Chuanhao Li, Kaipeng Zhang

  14. #298SkillZip: Contract-Preserving Graph Compression for Scalable Agent Skill Libraries

    SkillZip은 실행 계약을 보존하면서 실행 그래프를 압축하는 스케일러블 에이전트 스킬 라이브러리 시스템이다.

    Xingyu Tan, Xiaoyang Wang, Qing Liu, Xiwei Xu, Xin Yuan

  15. #305OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution

    OpenART는 복잡하고 진화하는 환경에서 에이전트 안전성을 평가하기 위한 대규모 레드팀 테스트 플랫폼으로, 환경 진화를 통해 85.0%의 공격 성공률을 달성한다.

    Yunhao Chen, Xin Wang, Yixu Wang, Yi Liu, Jie Li

  16. #306Self-Evolving Embodied Agents via Skill-Harness Evolution

    SHAPER는 모델 파라미터를 고정한 채, 재사용 가능한 스킬과 컨텍스트-코드 헤이버스를 진화시켜 자율적으로 적응하는 임베디드 에이전트를 구현하는 프레임워크이다.

    Peidong Wang, Zhiming Ma, Ying Chang, Xufang Luo, Xiaocui Yang

  17. #307PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives

    PlayWorld는 장기적 목표 기반의 대체적 에이전트 플레이어를 통해 비디오 월드 모델을 평가하는 벤치마크를 제시한다.

    Kaixin Ding, Xi Chen, Minghong Cai, Zhiyuan Xu, Yiyang Wang

  18. #308Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence

    SMA는 학습 없이 공간 경험을 재사용 가능한 교훈으로 전환하여 동결된 VLM의 공간 추론을 향상시키는 런타임 프레임워크이다.

    Haokai Zhang, Yuhang Ding, Yunshu Zhou, Xinze Du, Shengtao Zhang

  19. #309AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses

    강력한 모델이 추론 시점에서 약한 모델의 성능을 0.49에서 0.91로 향상시키는 추론 환경 설계 방법을 제안한다.

    Cheng Qian, Wenting Zhao, Liangwei Yang, Heng Wang, Jielin Qiu

  20. #310Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning

    CaRL을 통해 LLM이 무의미한 추론을 중단하고 능력 경계에 맞춘 행동을 학습한다.

    Xinyan Guan, Jiali Zeng, Chunlei Xin, Yaojie Lu, Hongyu Lin

  21. #311AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models

    AtlasVLA는 단일 워리스트 카메라로 장기적 작업을 수행하는 데 있어 지속적 세계-자기 상태를 모델링하여 기존 VLA 모델의 한계를 극복한 새로운 프레임워크이다.

    Guiyu Zhao, Longteng Guo, Yanghong Mei, Zilin Zhu, Yu Zhang

  22. #312LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers

    LLMRouter는 다양한 LLM 라우팅 정책을 개발·평가·배포하는 통합 인프라로, 16개 이상의 라우터와 xRouteBench 벤치마크를 제공하며 14.6%의 상대 성능 향상을 보인다.

    Tao Feng, Fangxu Yu, Haozhen Zhang, Zhongjie Dai, Liangqi Yuan

  23. #313Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence

    Mechanist는 AI 모델의 작동 메커니즘을 자동으로 탐색하는 시스템으로, 13,000개 논문 기반 지식그래프와 32개 메커니즘 해석 방법을 활용한다.

    Mengru Wang, Junfeng Fang, Shuofei Qiao, Zhenqian Xu, Haoming Xu

  24. #314Learning How the World Evolves: Extrapolative Video World Models via Latent Dynamics Reasoning

    LDR은 구조화된 잠재 공간에서 운동적 통합을 통해 동적을 학습하고, 기존 비전 확산 모델보다 훨씬 빠르고 정확하게 외삽하는 비디오 월드 모델이다.

    Haodong Li, Shaoteng Liu, Tianyu Wang, Chongjian Ge, Sihui Ji

  25. #315Structure-preserving uncertainty quantification for GENERIC dynamics

    S-PENNs는 물리 구조를 유지하면서 불확실성을 양자화하는 새로운 UQ 프레임워크로, GENERIC 역학에서 계산 비용을 1~3자리 줄이며 열역학적 일관성을 보장한다.

    Zequn He, Celia Reina

  26. #316DarwinX: Evolving Agent Harnesses Through Natural Selection

    DarwinX는 모델 가중치를 고정한 상태에서 헤이버스를 진화시켜 LLM 에이전트의 일반적 역량을 향상시키는 자연선택 기반 프레임워크이다.

    Yifan Zhang, Yutong Dai, Juntao Tan, Luyu Yang, Rishi Mullur

  27. #317Poor Man's Agentic Modeling: Simulating Large LLM-Agent Societies on a Laptop

    LLM 에이전트 사회 시뮬레이션을 저비용으로 대체할 수 있는 방법을 제안하며, 경제 시뮬레이션 EconAgent 등 8개 시스템에서 정량적으로 검증한다.

    Igor Itkin

  28. #318Intern-S2-Preview: Scientific Agentic Foundation Model

    Intern-S2-Preview-397B는 과학적 추론, 도구 상호작용, 장기적 작업을 지원하는 다중 모달 과학 에이전트 기반 모델이다.

    Lei Bai, Jiaqi Cao, Chiyu Chen, Guanzhou Chen, Kai Chen

  29. #319How Can Rhetoric Reward-Hack AI Reviewers? Dissecting Rhetorical Sensitivity in AI-Based Peer Review

    AI 리뷰어의 판단이 과학적 내용을 유지하면서도 수사적 표현에 따라 달라질 수 있음을 밝힌 연구.

    Ming Li, Chenguang Wang, Xirui Li, Xinyue Zeng, Dianqi Li

  30. #320AVA-Encoder: Towards Agent-Native Video Representation Learning

    AVA-Encoder는 영화 콘텐츠를 에이전트가 이해하고 편집할 수 있는 구조화된 지식 그래프로 변환하여, 에이전트 네이티브 비디오 표현 학습을 구현한다.

    Chuyue Li, Jinpeng Yu, Haozhe Wang, Tian Xueyun, Zhijing Zhang

인기 키워드

reinforcement-learning (331) diffusion-models (190) llm (190) llm-agents (160) video-generation (129) transformer (126) llm-evaluation (125) vision-language (112) vlm (109) long-context (99) large-language-models (94) code-generation (88) long-horizon (86) benchmark-evaluation (82) benchmarking (80) language-models (75) retrieval-augmented (73) flow-matching (68) world-models (68) foundation-models (67)