HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-08-18 featured 논문 30편

  1. #1PhysDreamer: Physics-Based Interaction with 3D Objects via Video Generation

    PhysDreamer는 3D 객체에 물리 기반 상호작용을 부여하여 새로운 자극에 대한 현실적인 동작을 생성하는 시스템이다.

    Tianyuan Zhang, Hong-Xing Yu, Rundi Wu, Brandon Y. Feng, Changxi Zheng

  2. #2FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving

    FSDrive는 시공간적 Chain-of-Thought(CoT)를 활용해 자율주행 모델이 시각적으로 추론하도록 돕는 새로운 프레임워크이다.

    Shuang Zeng, Xinyuan Chang, Mengwei Xie, Xinran Liu, Yifan Bai

  3. #3Agent Workflow Memory

    AWM은 웹 탐색 작업에서 성능을 향상시키기 위해 반복적으로 사용되는 작업 흐름을 추출하고 이를 에이전트 메모리에 통합하는 방법이다.

    Z. Wang, Jiayuan Mao, Daniel Fried, Graham Neubig

  4. #5Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination

    RA-Bench라는 새로운 벤치마크를 통해 AI 생성 영상의 탐지 실효성을 평가하고, 사회적 위기 상황에서의 탐지 난이도를 분석한다.

    Shuo Liang, Yixing Ma, Pengfei Zhou, Xingyan Chen, Zihan Mei

  5. #6WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models

    WebVoyager는 실제 웹사이트와 상호작용하여 사용자 지시를 end-to-end로 처리하는 LMM 기반 웹 에이전트로, 59.1%의 태스크 성공률을 달성했다.

    Hongliang He, Wenlin Yao, Kaixin Ma, Wenhao Yu, Yong Dai

  6. #7SV3D: Novel Multi-view Synthesis and 3D Generation from a Single Image using Latent Video Diffusion

    SV3D는 단일 이미지로부터 높은 해상도의 3D 객체 생성과 다각도 뷰 시너지스를 달성하는 라티언트 비디오 디퓨전 모델이다.

    Vikram S. Voleti, C. Yao, Mark Boss, Adam Letts, David Pankratz

  7. #8Improving Online Algorithms via ML Predictions

    머신러닝 예측을 활용한 온라인 알고리즘 개선을 위한 이론적 연구.

    Manish Purohit, Zoya Svitkina, Ravi Kumar

  8. #9MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention

    MInference는 10배 가속화된 A100 GPU 기반 1M 토큰 프리필링을 위한 동적 희소 어텐션 기법이다.

    Huiqiang Jiang, Yucheng Li, Chengruidong Zhang, Qianhui Wu, Xufang Luo

  9. #10NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models

    NaturalSpeech 3는 FVQ와 factorized diffusion 모델을 결합해 zero-shot 환경에서 자연스러운 음성을 생성하는 TTS 시스템이다.

    Zeqian Ju, Yuancheng Wang, Kai Shen, Xu Tan, Detai Xin

  10. #11MLLM-as-a-Judge: Assessing Multimodal LLM-as-a-Judge with Vision-Language Benchmark

    MLLM-as-a-Judge 벤치마크를 통해 MLLM의 판단 능력을 평가하고, 인간 기준과의 차이를 분석한다.

    Dongping Chen, Ruoxi Chen, Shilin Zhang, Yinuo Liu, Yaochen Wang

  11. #12Large Brain Model for Learning Generic Representations with Tremendous EEG Data in BCI

    LaBraM은 2,500시간 이상의 EEG 데이터로 사전 학습한 대규모 뇌 신호 모델로, 다양한 BCI 태스크에서 기존 최고 성능을 초과한다.

    Wei-Bang Jiang, Li-Ming Zhao, Bao-Liang Lu

  12. #220MobileMem: Learning from a Year of Mobile Experiences

    MobileMem은 모바일 환경에서의 장기 기억 시스템을 평가하기 위한 벤치마크와 프레임워크로, 사용자의 일년 분량의 경험을 기반으로 구성된다.

    Xinle Deng, Yida Xue, Xiangyuan Ru, Haoming Xu, Shuofei Qiao

  13. #305PRM-as-a-Judge 1.5: A Toolkit for Robot Process Assessment

    PRM-as-a-Judge 1.5는 로봇 실행 과정을 정밀하게 평가하는 툴킷으로, 실패 측 진행, 회복, 성공 측 실행 품질을 측정한다.

    Yuyang Liu, Yanqing Shen, Ruike Chen, Jifan Zhao, Yuxuan Tian

  14. #306Claim-Level Reliability Assessment for Efficient Test-Time Reasoning

    CLR은 테스트 시 계산 자원을 효율적으로 재할당하여 추론 정확도를 향상시키는 훈련 없는 프레임워크이다.

    Sen Xu, Wei Wang, Shixi Liu, Jixin Min, Yingwei Dai

  15. #307Modular Cognitive Architecture Emerges in Large Language Models

    LLM에서 인간 뇌와 유사한 모듈식 구조가 나타난다는 것을 실증적으로 밝힘.

    Pengrui Han, Jacob Andreas, Evelina Fedorenko, Andrea Gregor de Varda

  16. #308Self-Supervised Visual On-Policy Distillation

    S²VOPD는 강화된 학습 신호를 생성하기 위해 학습자의 입력에 정보를 제거하는 방식으로, 특권 정보 없이도 정교한 시각 인식 성능을 향상시킨다.

    Yijiang Li, Yijun Liang, Yunjie Tian, Bingyang Wang, Ke Zhang

  17. #309Marionette: Predicting World States, Rendering Geometry, Painting Appearance

    Marionette는 3D 월드 상태를 예측하고 렌더링, 관찰을 분리하여 게임 세계 모델의 제어성과 일관성을 향상시킨다.

    Zian Meng, Zhen Li, Chuanhao Li, Qiang Li, Kaipeng Zhang

  18. #313CW-BASS v2: Saturation-Aware Pseudo-Label Selection for Semi-Supervised Segmentation under Foundation-Model Teachers

    CW-BASS v2는 DINOv2와 같은 강력한 foundation 모델의 confidence saturation 현상을 고려한 pseudo-label 선택 방법이다.

    Ebenezer Tarubinga

  19. #314Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development

    7개 최첨단 모델을 36개 장기 과제에서 평가하여, 현재 자율 에이전트가 연구자보다 공학 최적화에 더 가까운 성능을 보임을 밝힘.

    Yiwei Li, Wanli Yang, Hexiang Tan, Xiangzhou Huang, Zhengyu Chen

  20. #315Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning

    Mobius-v0는 지식 저장과 추론 계산을 분리한 아키텍처로, 4× 추론 가속과 62.6% 훈련 데이터 절감을 달성한다.

    Kai Chen, Jifeng Ding, Ning Ding, Jiaye Ge, Lixin Gu

  21. #318SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning

    SimpleOPD는 토크나이저 차이를 고려한 온-폴리시 디스틸레이션으로 수학 증명 능력을 전이시켜 모델 성능을 향상시킨다.

    Haonan He, Haodi Lei, Yun Luo, Haoran Zhang, Shunkai Zhang

  22. #319Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence

    Apodex Discovery는 실제 문제 해결을 위한 AI 평가 프레임워크로, AAV 캡시드 설계에서 기존 최고 성능을 7% 초과 달성.

    Brian Wang, Bin Feng, Xiaoman Pan, Chenyang An, Felix Liu

  23. #320DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data

    Mimir v1은 허가된 데이터만을 사용해 10억 파라미터 HRM 모델로, 영어 및 덴마크어 벤치마크에서 뛰어난 성능을 보인다.

    Peter Schneider-Kamp, Jacob Nielsen, Gianluca Barmina, Kenneth Enevoldsen, Lukas Galke Poech

  24. #321Amplified Does Not Mean Predictive: Reasoning Behaviors in Thinking Models

    15개 모델을 대상으로 15,282개 추론 트레이스를 분석하여, 사고 훈련이 정확도와 강하게 연관된 행동을 증폭시키지 않는다는 사실을 밝힘.

    Jean de Dieu Nyandwi, Leena Mathur, Yonatan Bisk, Robert Hawkins, Graham Neubig

  25. #322HumanTracker: Towards Comprehensive and Human-Aligned Motion Tracking Benchmark

    HumanTracker는 인간의 인식과 일치하는 대규모 인간 모션 추적 벤치마크와 HumanScore라는 인간 선호도 기반 평가 지표를 제안한다.

    Dairu Liu, Zekun Qi, Jiayu Zeng, Ruixi Yu, Yu Guan

  26. #323An AI4AI Framework for Visual Token Pruning

    AutoPrune는 LLM 기반의 시각 토큰 정제 정책을 설계하는 AI4AI 프레임워크로, 94.4%의 토큰 제거에도 99% 이상의 성능을 유지한다.

    Zhen Liu, Wenli Huang, Wei Song, Yuhan Liu, Zhiqin Yang

  27. #324Maglev: Sliding Recurrent Memory

    Maglev는 슬라이딩 윈도우 어텐션을 일반화하면서 추론 시 고정 메모리로 작동하는 반복 트랜스포머 구조를 제안한다.

    Bo Liu, Qiang Liu

  28. #325Thought-Level Beam Search for Reasoning

    Gambit는 토큰 소비를 최대 68.5% 절감하면서도 AIME-25에서 +3.3%의 정확도 향상을 달성한 사고 수준 빔 서치 알고리즘입니다.

    Lijie Yang, Hongyin Luo, Jiawei Zhao, Tri Dao, Ravi Netravali

  29. #326SKILLER: Language-Level Reinforcement Learning for Reusable Skill Extraction in Small Language Models

    SKILLER는 소형 언어 모델에 맞춤형으로 스킬을 생성하는 자연어 기반 강화 학습 프레임워크로, Qwen3.5-9B와 Qwen3.5-4B에서 기존 방법 대비 최대 20.4%의 성능 향상을 달성했다.

    Chenhao Dang, Siyuan Xiong, Conghui He, Weijia Li

  30. #327Context-Matched Distillation: Teacher Causality for Autoregressive Video Distillation

    Context-Matched Distillation(CMD)는 자율적 비디오 생성에서 교사-학생 간 정보 불일치를 해결하여 생성 품질과 제어 정확도를 향상시키는 인과적 지도 프레임워크이다.

    Hmrishav Bandyopadhyay, Xuanchi Ren, Zijian Huang, Jay Zhangjie Wu, Tianshi Cao

인기 키워드

reinforcement-learning (331) diffusion-models (190) llm (190) llm-agents (160) video-generation (129) transformer (126) llm-evaluation (125) vision-language (112) vlm (109) long-context (99) large-language-models (94) code-generation (88) long-horizon (86) benchmark-evaluation (82) benchmarking (80) language-models (75) retrieval-augmented (73) flow-matching (68) world-models (68) foundation-models (67)