HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-08-05 featured 논문 30편

  1. #1RealNet: A Feature Selection Network with Realistic Synthetic Anomaly for Anomaly Detection

    RealNet은 SDAS, AFS, RRS를 결합한 새로운 이상 탐지 프레임워크로, MVTec-AD 등 4개 데이터셋에서 기존 최고 성능을 개선한다.

    Ximiao Zhang, Min Xu, Xiuzhuang Zhou

  2. #2PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs

    PIVOT는 VLM을 사용한 시각적 반복 프롬프팅을 통해 로봇 제어 및 공간 추론을 제로샷으로 수행하는 새로운 접근법이다.

    Soroush Nasiriany, Fei Xia, Wenhao Yu, Ted Xiao, Jacky Liang

  3. #3Timer: Generative Pre-trained Transformers Are Large Time Series Models

    Timer는 대규모 사전학습을 통해 생성적 타임시리즈 모델로, 다양한 분석 작업을 통합 처리한다.

    Yong Liu, Haoran Zhang, Chenyu Li, Xiangdong Huang, Jianmin Wang

  4. #4Autoregressive Image Generation without Vector Quantization

    이미지 생성에서 벡터 쿼언티제이션 없이 확산 손실을 기반으로 오토회귀 모델을 적용한 새로운 접근법을 제안한다.

    Tianhong Li, Yonglong Tian, He Li, Mingyang Deng, Kaiming He

  5. #5SiT: Exploring Flow and Diffusion-based Generative Models with Scalable Interpolant Transformers

    SiT는 DiT 기반으로 설계된 생성 모델로, 다양한 디퓨전 계수와 연속 시간 학습을 통해 ImageNet에서 FID-50K 2.06을 달성한다.

    Nanye Ma, Mark Goldstein, M. Albergo, N. Boffi, Eric Vanden-Eijnden

  6. #6Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces

    MLLMs가 비디오 기반 공간 인지 능력을 갖는지 탐구한 연구로, VSI-Bench라는 새로운 벤치마크를 제시하고 공간 추론 능력 향상을 위한 인지 지도 생성 방법을 제시.

    Jihan Yang, Shusheng Yang, Anjali Gupta, Rilyn Han, Fei-Fei Li

  7. #7How Johnny Can Persuade LLMs to Jailbreak Them: Rethinking Persuasion to Challenge AI Safety by Humanizing LLMs

    일상적 설득 기법을 활용한 LLM 해킹(Persuasive Jailbreak)이 기존 알고리즘 기반 공격을 크게 초과하며, AI 안전성 연구의 새로운 관점을 제시한다.

    Yi Zeng, H. Lin, Jingwen Zhang, Diyi Yang, Ruoxi Jia

  8. #8Self-Rewarding Language Models

    자체적으로 보상을 생성하는 Self-Rewarding Language Models를 제안하여 LLM의 지속적 성능 향상을 실현한다.

    Weizhe Yuan, Richard Yuanzhe Pang, Kyunghyun Cho, Sainbayar Sukhbaatar, Jing Xu

  9. #9Evaluating Very Long-Term Conversational Memory of LLM Agents

    LLM 에이전트의 매우 장기적 대화 기억 능력을 평가하기 위해 LoCoMo 데이터셋과 3가지 평가 태스크를 제시하며, LLM의 장기 기억 처리 능력이 여전히 인간 수준에 크게 못 미친다는 것을 밝힘.

    Adyasha Maharana, Dong-Ho Lee, S. Tulyakov, Mohit Bansal, Francesco Barbieri

  10. #10SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training

    SFT는 데이터를 암기하지만, RL은 GeneralPoints와 V-IRL에서 33.8% 성능 향상과 함께 일반화 능력을 높인다.

    Tianzhe Chu, Yuexiang Zhai, Jihan Yang, Shengbang Tong, Saining Xie

  11. #296DiffusionGemma Technical Report

    DiffusionGemma는 고속 텍스트 생성을 위한 이산 확산 기반 언어 모델로, 기존 오토회귀 모델 대비 1,500 토큰/초의 속도를 달성한다.

    DiffusionGemma Team, Adrien Ali Taïga, James Assiene, Daniele Calandriello, Rahma Chaabouni

  12. #298Mental World Modeling

    MWM은 물리적 상태뿐 아니라 정신 상태까지 통합한 세계 모델링 프레임워크로, 인간 행동 예측 정확도를 향상시킨다.

    Hao Fei, Yiran Zhao

  13. #303LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation

    LeapTalk은 단일 단계로 200 FPS의 실시간 토킹헤드 생성을 가능하게 하며, 지나치게 많은 단계를 요구하는 확산 모델과 오류 누적 문제를 해결한다.

    Rongxiang Zhang, Songhua Liu

  14. #304WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning

    WCM은 VLA-RL에서 관찰 역사와 환경 역학을 동시에 학습하는 World Critic Model로, 149개 태스크에서 SOTA 성능을 달성했다.

    Senyu Fei, Xiaopeng Yu, Siyin Wang, Xianzhong Zhao, Jingjing Gong

  15. #305LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks

    LongHorizon-Harness는 MEA 루프를 통해 장기적 작업의 신뢰성을 향상시키는 새로운 에이전트 프레임워크이다.

    Ziyu Ma, Hailang Huang, Shun Zou, Yong Wang, Shidong Yang

  16. #306SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks

    SwanTale은 자연어와 제로샷 기반의 다발성 음성 및 오디오 생성을 지원하는 통합 모델로, SwanData-Caption 데이터셋과 SwanVAE, Unified MoE 등 다양한 기술을 결합하여 뛰어난 표현력을 달성했다.

    Yu Zhang, Ruiqi Li, Changhao Pan, Ke Lei, Xiang Yin

  17. #307DreamTraj: Generating 6-DoF Object Trajectories by Reading Unrendered Video Diffusion Latents

    DreamTraj는 단일 RGB 이미지와 작업 지시문으로 6-DoF 물체 궤적을 생성하는 새로운 접근법으로, 비디오 생성 없이 확산 모델 내부 표현에서 직접 추출한다.

    Tongsheng Ding, Zhen Luo, Yixuan Yang, Boyu Wang, Luyang Xie

  18. #308Weak-to-Strong On-Policy Distillation

    W2S-OPD는 강한 학습자 모델을 여러 약한 모델로부터 학습시켜 성능을 향상시키는 새로운 온-포리시 디스틸레이션 프레임워크이다.

    Fangxu Yu, Weijia Xu, Michael Xu, Tianyi Zhou, Zinan Lin

  19. #309DAPD: Dual-Anchored Policy Distillation

    DAPD는 정보 비대칭 문제를 해결해 on-policy distillation에서의 privilege illusion을 완화하고, Qwen3-4B에서 평균 +2.00점 개선을 달성한 새로운 정책 증류 프레임워크이다.

    Jianyu Wu, Yizhou Wang, Encheng Su, Chen Tang, Shixiang Tang

  20. #310Progressive Agent Skill Generation via Reinforcement Learning

    Skill-α는 강화학습을 활용해 문서 및 경험에서 고질적인 에이전트 스킬을 점진적으로 생성하는 방법이다.

    Junhao Shen, Zhanqiu Zhang, Yiwen Guo, Hong Cheng

  21. #311EMBL AI Librarian: Life-Sciences Knowledge Layer for AI Agents

    EMBL AI Librarian는 자연어 질의를 기반으로 생물학적 문헌 증거를 추출하는 AI 에이전트용 지식 레이어를 제시한다.

    Luigi Sigillo, Matteo Silvestri, Francesco Tabaro, Rajat Bhatnagar, Syed Irtaza Mubashar

  22. #312VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation

    VAD는 시각적 증거 기반의 교정 성분을 추정하고 재구성하여 멀티모달 온-폴리시 디스틸레이션의 성능을 향상시킨다.

    Kangning Zhang, Yixing Li, Shuai Shao, Qingyao Li, Zhengxi Lu

  23. #313WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity

    WorldExam은 1,474개의 테스트 케이스로 구성된 비디오 월드 모델 평가 벤치마크로, 시각적 품질을 넘어 내재적 반응성을 평가한다.

    Yuxue Yang, Shuyao Shang, Jiahe Wang, Zitong Zhou, Liang Tan

  24. #314CADENA: Stepwise CAD Reverse Engineering

    CADENA는 3D 메시지를 단계별로 파라메트릭 CAD 프로그램으로 재구성하는 모델로, 기존 방법 대비 정확도를 향상시킨다.

    Soslan Kabisov, Gennadiy Savrasov, Maksim Elistratov, Antonio Rodriguez, Daniil Ignatiev

  25. #315UEmbed: Unified Sparse and Dense Multimodal Embeddings

    UEmbed는 단일 모델로 텍스트 및 다중 모달의 밀집형과 희소형 임베딩을 동시에 생성하는 디코더 전용 모델이다.

    Tingyu Song, Mingxin Li, Yanzhao Zhang, Dingkun Long, Pengjun Xie

  26. #316SAF-OPD: Stable Advantage Fusion for On-Policy Distillation

    SAF-OPD는 RLVR과 OPD의 결합 시 발생하는 신호 불균형 문제를 해결해 정확도를 0.51–2.70% 개선한다.

    Yifan Ding, Xincheng Wei, Yoshua Y. Li, Ziheng Li, Yuquan Lu

  27. #317In the Driver's Seat: A Multi-Company Study on the Reality of Autonomous Driving System Testing

    9개 회사 전문가 인터뷰를 통해 자율주행 시스템 테스트의 현황과 문제점을 분석하고, 폐루프 테스트 프레임워크를 제안한 연구.

    Qunying Song, Yuan Gao, Johannes Betz, Dietmar Pfahl, Mohammad Reza Mousavi

  28. #318Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs

    자율주행 VLM에서 미래 경로를 지연 노출하여 검증 가능한 추론을 구현하는 DEFT-RLVR과 AD-MCQ를 제안한다.

    Zixuan Huang, Yang Zhou, Kaixuan Wang, Guli Zhang, Hongyan Xie

  29. #319SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation

    SKT는 2,000개 공개 스킬을 기반으로 27,164개 검증된 실행 경로를 생성하여 LLM의 스킬 활용 능력을 향상시키는 데이터 합성 파이프라인이다.

    Zelin Tan, Yiqun Zhang, Hao Li, Zhiyao Cui, Hejia Geng

  30. #320Fewer Clarifications, Better Code: Benchmarking Cross-Session Personalized Ambiguity Adaptation in Coding Assistants

    CAPA 벤치마크를 통해 사용자별 반복적 모호성을 최소 클리어런스로 해결하는 코드 어시스턴트의 성능을 평가한다.

    Zijian Xu, Wenshuo Zhang, Zisen Qin, Rui Sheng, Yushi Sun

인기 키워드

reinforcement-learning (282) llm (160) diffusion-models (156) llm-agents (124) vlm (103) video-generation (102) transformer (97) llm-evaluation (95) vision-language (83) long-context (77) code-generation (67) benchmark-evaluation (66) long-horizon (63) language-models (59) large-language-models (59) retrieval-augmented (58) foundation-models (57) benchmarking (55) flow-matching (54) text-to-image (54)