HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-09-06 featured 논문 30편

  1. #1PromptAD: Learning Prompts with only Normal Samples for Few-Shot Anomaly Detection

    PromptAD는 정상 샘플만을 사용해 few-shot 환경에서 이상 탐지를 수행하는 one-class prompt 학습 방법으로, MVTec 및 VisA 데이터셋에서 11/12 설정에서 1위 성능을 달성한다.

    Xiaofan Li, Zhizhong Zhang, Xin Tan, Chengwei Chen, Yanyun Qu

  2. #2Kernel Language Entropy: Fine-grained Uncertainty Quantification for LLMs from Semantic Similarities

    Kernel Language Entropy(KLE)는 LLM의 의미적 불확실성을 정량화하기 위한 새로운 방법으로, 기존 semantic entropy를 일반화하고 여러 생성 데이터셋에서 성능을 개선한다.

    Alexander Nikitin, Jannik Kossen, Y. Gal, Pekka Marttinen

  3. #3RoboTok: An Internet-Scale Data Engine for Human Demonstration Retrieval and Dexterous Manipulation Learning

    RoboTok은 인터넷 영상에서 인간 조작 동작을 추출해 로봇 정책 학습에 활용하는 대규모 데이터 엔진이다.

    Howard Qian, Yiting Chen, Yunfei Xie, Kejia Ren, Podshara Chanrungmaneekul

  4. #4Watch Out for Your Agents! Investigating Backdoor Threats to LLM-Based Agents

    LLM 기반 에이전트에 대한 백도어 공격의 다양한 형태와 취약성을 분석하고, 기존 방어법의 한계를 밝힌 연구.

    Wenkai Yang, Xiaohan Bi, Yankai Lin, Sishuo Chen, Jie Zhou

  5. #5VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement

    VeriPhy는 생성된 동영상의 물리적 일관성을 체계적으로 검증하는 시스템으로, 149개 클립에서 304개 결함 중 228개를 감지했다.

    Wenzhuo Xu, Yuchen Zhu, Chongjian Ge, Xuan Shen, Jing Shi

  6. #6MiniCheck: Efficient Fact-Checking of LLMs on Grounding Documents

    MiniCheck는 GPT-4 수준의 정확도를 400배 저비용으로 달성하는 소형 사실 검증 모델이다.

    Liyan Tang, Philippe Laban, Greg Durrett

  7. #7Sapiens: Foundation for Human Vision Models

    Sapiens는 1K 해상도에서 2D 포즈, 부위 세그멘테이션, 깊이, 표면 정규 벡터 예측을 수행하는 인간 중심 시각 모델로, 300M 개의 인간 이미지로 학습하여 기존 기준을 7.6 mAP~53.5% 개선한다.

    Rawal Khirodkar, Timur M. Bagautdinov, Julieta Martinez, Zhaoen Su, A. James

  8. #8ArtPrompt: ASCII Art-based Jailbreak Attacks against Aligned LLMs

    ASCII 아트를 활용한 새로운 제이크브레이크 공격 ArtPrompt가 기존 안전 정렬 기법의 취약점을 드러낸다.

    Fengqing Jiang, Zhangchen Xu, Luyao Niu, Zhen Xiang, Bhaskar Ramasubramanian

  9. #9EMO: Emote Portrait Alive - Generating Expressive Portrait Videos with Audio2Video Diffusion Model under Weak Conditions

    EMO는 오디오-비디오 확산 모델을 활용해 3D 중간 표현 없이 표현력 있는 토킹헤드 영상을 생성하는 새로운 프레임워크이다.

    Linrui Tian, Qi Wang, Bang Zhang, Liefeng Bo

  10. #10Are Language Models Actually Useful for Time Series Forecasting?

    대형 언어 모델(LLM)은 시계열 예측에서 성능 개선에 기여하지 않으며, 단순한 대체 모듈이 더 효율적임을 밝힘.

    Mingtian Tan, Mike A. Merrill, Vinayak Gupta, Tim Althoff, Thomas Hartvigsen

  11. #11Shape of Motion: 4D Reconstruction From a Single Video

    단일 비디오에서 3D 운동 궤적을 포함한 4D 재구성을 위한 새로운 방법을 제안한다.

    Qianqian Wang, Vickie Ye, Hang Gao, Jake Austin, Zhengqi Li

  12. #12AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling

    AnyGPT는 텍스트, 이미지, 음성, 음악 등 다양한 모달을 이산 시퀀스로 통합 처리하는 any-to-any 멀티모달 언어 모델이다.

    Jun Zhan, Junqi Dai, Jiasheng Ye, Yunhua Zhou, Dong Zhang

  13. #303Compile by Training: Turning Natural-Language Specifications into Local Neural Functions

    자연어 명세를 기반으로 로컬 신경망 함수를 생성하는 "Compile by Training" 방법을 제안한다.

    Yuntian Deng, Pengyu Nie, Stuart Shieber

  14. #304Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments

    Terminal-Universe는 기존 에이전트 트레이잭토리에서 실행 가능한 환경을 재구성하고 새로운 작업을 합성하여 터미널 기반 코드 에이전트의 학습을 확장하는 프레임워크이다.

    Jie Wu, Zhenru Zhang, Beichen Zhang, Xuwu Wang, Yuhui Su

  15. #305LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes

    LLaDA-Image는 6B 규모의 DiT와 LLaDA2.0-Mini 기반 VLM을 결합한 오픈소스 이미지 생성 프레임워크로, 220M 샘플 중 98%가 실제 이미지이며 Qwen-Image-Bench에서 53.53 점을 달성했다.

    Chuyan Chen, Haoxing Chen, Kun Chen, Zhenglin Cheng, Long Cui

  16. #306Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning

    Random Attention은 KV 캐시에서 무작위 추출을 통해 기존 선택 신호를 대체하면서도 성능을 유지하고 처리량을 32–43% 증가시킨다.

    Heng Wang, Jielin Qiu, Wenting Zhao, Cheng Qian, Liangwei Yang

  17. #307Knowing When Not to Reuse: Conditional Experience Transfer in Autonomous LLM Post-Training

    BCIT는 자율적 사후 훈련에서 과거 경험의 조건부 재사용을 결정하는 문제를 해결하는 방법이다.

    Tingyun Li, Wenfeng Feng, Weiqing Li, Abudukelimu Wuerkaixi, Guohua Liu

  18. #308LatentPress: Context Compression Beyond Text and Vision

    LatentPress는 언어 모델이 텍스트 복원 없이 직접 읽을 수 있는 연속 메모리 토큰을 생성하여 대규모 컨텍스트를 압축하는 새로운 인터페이스를 제시한다.

    Zhengze Zhou, Hejian Sang

  19. #309Rethinking On-Policy Distillation of Large Language Models II: One Training Example

    단일 훈련 예시로도 대규모 언어 모델의 온-폴리시 디스틸레이션(OPD) 성능을 크게 회복할 수 있음을 밝힘.

    Zixuan Fu, Bingxiang He, Yuxin Zuo, Haohuan Huang, Jinqian Zhang

  20. #310Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLM

    Gated DeltaNet(GDN) 기반의 Qwen3.8-27B 모델을 NVFP4 W4A4로 전체 496개의 선형층을 4비트로 양자화하여 BF16 수준 성능을 달성한 연구.

    Sergii Kozyrev, Davyd Maiboroda

  21. #311Puffin-World: Scaling a Unified Multimodal Model with Native 3D World States

    Puffin-World는 물리, 기하, 외관을 통합한 3D 월드 생성 및 재구성을 위한 단일 프레임워크로, Omni-Camera와 Physics Propagation을 통해 물리적으로 일관되고 시각적으로 안정적인 월드 모델링을 실현한다.

    Kang Liao, Yihang Luo, Xiao-Ming Wu, Linyi Jin, Size Wu

  22. #312Scal3R: Learning Efficient Multi-Relative Pose Query for Scalable Online 3D Reconstruction

    Scal3R은 KITTI 데이터셋에서 평균 ATE를 60% 이상 개선하며, 1% 미만의 파라미터로 온라인 3D 재구성을 안정적으로 수행하는 다중 참조 상대 자세 쿼리 프레임워크이다.

    Chin-Yang Lin, Yang-Che Sun, Cheng Sun, Fu-En Yang, Min-Hung Chen

  23. #313Editable Visual Design

    "Editable Visual Design"은 코드 생성과 시각 생성 모델을 결합해 편집 가능한 디자인을 실현하는 새로운 패러다임이다.

    Junyan Ye, Wei Liu, Dongzhi Jiang, Zichen Wen, HaoDong Li

  24. #314The Missing Temporal Link: Temporal Context Routing for Script-Driven Audio-Video Generation

    TCR은 스크립트 기반 동영상 생성에서 비디오와 오디오의 타이밍을 스크립트와 정확히 맞추는 기술로, Shot Boundary MAE 96% 감소, Dialogue [email protected] 84.1% 달성.

    Yichen Liu, Quanwei Zhang, Haozhe Wang, Donghao Zhou, Xiaojie Li

  25. #316Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding

    LatentStream은 스트리밍 영상 이해를 위해 내재적 잠재 메모리 진화를 통해 기존의 저장-검색 패러다임을 극복하는 프레임워크로, 다양한 벤치마크에서 최신 성능을 달성한다.

    Hongyu Qu, Guangming Yao, Ling Xing, Xiaobin Hu, Rongxing Ding

  26. #317WHALE: A Simple Recipe for Joint Harness-Weight Optimization

    WHALE은 모델 가중치와 실행 가능한 헤이븐 코드를 번갈아 최적화함으로써 에이전트 성능을 향상시키는 모듈식 프레임워크이다.

    Haechan Kim, Yoonho Lee, Gisang Lee, Chelsea Finn, Kangwook Lee

  27. #319Last Translation Benchmark

    기존 기계 번역 모델의 한계를 평가하기 위한 새로운 벤치마크인 Last Translation Benchmark(LTB)를 제안한다.

    Vilém Zouhar, Niyati Bafna, Mukund Choudhary, Maike Züfle, Sara Rajaee

  28. #320RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests

    RealSWE는 실제 사용자 요청에 기반한 코드 생성 에이전트 평가 프레임워크로, 정보 구성과 언어 스타일의 차이를 분석하고 이를 기반으로 381개의 다중 변형 태스크를 제공한다.

    Gyuhyeong Kim, Hyojung Gwon, Jeonghyeon Kim, Kyuhong Shim, Sunjae Lee

  29. #321CORE: Improving Compositional Reasoning in MLLM Embedding via Reranker Distillation

    CORE는 MLLM 기반 임베딩 모델의 구성적 추론 능력을 랭커를 통해 증대시키는 랭크-디스틸레이션 기반 프레임워크이다.

    Tingyu Song, Mingxin Li, Yanzhao Zhang, Dingkun Long, Chu Liu

  30. #322NeoMME: A Single-Tower Multimodal-Native Multilingual Foundation Encoder for Efficient Fine-Tuning and Inference

    NeoMME는 단일 트랜스포머 인코더로 멀티모달 및 다국어 텍스트와 이미지를 처리하는 효율적인 기반 모델이다.

    Aurélien Lac, Tony Wu

인기 키워드

reinforcement-learning (331) diffusion-models (191) llm (191) llm-agents (160) video-generation (130) llm-evaluation (127) transformer (126) vision-language (114) vlm (109) long-context (99) large-language-models (94) code-generation (88) long-horizon (86) benchmark-evaluation (84) benchmarking (80) language-models (76) retrieval-augmented (74) flow-matching (68) world-models (68) foundation-models (67)