HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-08-17 featured 논문 30편

  1. #2MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding

    MedXpertQA는 4,460개의 전문의 수준 질문을 포함한, 의료 분야의 전문 지식과 고급 추론 능력을 평가하는 종합적 벤치마크이다.

    Yuxin Zuo, Shang Qu, Yifei Li, Zhangren Chen, Xuekai Zhu

  2. #4Agent Laboratory: Using LLM Agents as Research Assistants

    LLM 에이전트 기반 연구 프레임워크인 Agent Laboratory가 연구 과정을 자동화하고 연구 비용을 84% 절감하는 것을 보여준다.

    Samuel Schmidgall, Yusheng Su, Ze Wang, Ximeng Sun, Jialian Wu

  3. #5VACE: All-in-One Video Creation and Editing

    VACE는 다양한 비디오 생성 및 편집 작업을 하나의 모델로 통합한 All-in-One 프레임워크로, VCU와 Context Adapter를 통해 다중 조건 입력을 유연하게 처리한다.

    Zeyinzi Jiang, Zhen Han, Chaojie Mao, Jingfeng Zhang, Yulin Pan

  4. #6SpinQuant: LLM quantization with learned rotations

    SpinQuant은 LLM의 4비트 양자화 성능을 회전 행렬 학습을 통해 2.9% 이하로 감소시키는 새로운 양자화 기법이다.

    Zechun Liu, Changsheng Zhao, Igor Fedorov, Bilge Soran, Dhruv Choudhary

  5. #7TravelPlanner: A Benchmark for Real-World Planning with Language Agents

    TravelPlanner는 실제 여행 계획을 기반으로 언어 에이전트의 복잡한 계획 능력을 평가하는 새로운 벤치마크로, GPT-4조차 0.6%의 성공률에 그친다.

    Jian Xie, Kai Zhang, Jiangjie Chen, Tinghui Zhu, Renze Lou

  6. #8MonST3R: A Simple Approach for Estimating Geometry in the Presence of Motion

    MonST3R은 동적 장면에서 직접 3D 기하를 추정하는 단순한 접근법으로, DUST3R의 포인트맵을 활용해 동작 없이도 높은 정확도를 보인다.

    Junyi Zhang, Charles Herrmann, Junhwa Hur, Varun Jampani, Trevor Darrell

  7. #9Training Language Models to Self-Correct via Reinforcement Learning

    SCoRe는 강화학습을 활용해 LLM이 자체적으로 오류를 수정하는 능력을 향상시키는 다단계 온라인 학습 방법이다.

    Aviral Kumar, Vincent Zhuang, Rishabh Agarwal, Yi Su, John D. Co-Reyes

  8. #10Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference

    Quest는 쿼리에 따라 KV 캐시의 핵심 토큰을 선택적으로 처리하여, 긴 문맥의 LLM 추론 속도를 7.03× 가속화하는 알고리즘이다.

    Jiaming Tang, Yilong Zhao, Kan Zhu, Guangxuan Xiao, Baris Kasikci

  9. #11Panda-70M: Captioning 70M Videos with Multiple Cross-Modality Teachers

    Panda-70M은 7000만 개의 고해상도 영상에 텍스트 캡션을 부여한 대규모 자동 생성 데이터셋으로, 다중 교사 모델을 활용한 자동 캡셔닝 파이프라인을 제시한다.

    Tsai-Shien Chen, Aliaksandr Siarohin, W. Menapace, Ekaterina Deyneka, Hsiang-wei Chao

  10. #12SliceGPT: Compress Large Language Models by Deleting Rows and Columns

    SliceGPT는 행렬의 행/열을 제거해 LLM을 압축하는 post-training 스파스화 기법으로, 25% 파라미터 제거에도 90% 이상의 성능 유지.

    Saleh Ashkboos, Maximilian L. Croci, Marcelo Gennari Do Nascimento, Torsten Hoefler, James Hensman

  11. #317AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design

    AutoDesign은 학술 논문을 포스터로 자동 생성하는 과정에서 인간 선호에 맞춘 재귀적 개선을 통해 78.32 점을 달성한 메타-해버 시스템 최적화 프레임워크이다.

    Yaxin Luo, Haobin Jiang, Jialv Zou, Xu Huang, Wenhao Yan

  12. #318From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs

    저주파 수음 불가 신호가 대규모 오디오-언어 모델(LALM)의 안정성에 심각한 위협을 가하며, 이를 평가하고 완화하기 위한 ILL과 DRG 방법이 제안된다.

    Yuanhe Zhang, Weiliu Wang, Jie Ren, Liang Lin, Zhenhong Zhou

  13. #319TailBooster: A Dual-Layer Generative Framework for Extreme Value Augmentation with Operational Validity Enforcement

    TailBooster는 극단적 항공 운항 데이터를 생성하면서 운영 적합성을 보장하는 이중 계층 생성 프레임워크이다.

    Karim Aly, Alexei Sharpanskykh, Jacco Hoekstra

  14. #320CW-BASS v2: Saturation-Aware Pseudo-Label Selection for Semi-Supervised Segmentation under Foundation-Model Teachers

    CW-BASS v2는 DINOv2와 같은 강력한 foundation 모델의 confidence saturation 현상을 고려한 pseudo-label 선택 방법이다.

    Ebenezer Tarubinga

  15. #322Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus

    혼합형 선형 어텐션 대형 언어 모델(HLA LLM)에서 대규모 활성화(MA)의 두 가지 형태, pre-attention spikes(PAS)와 inter-spike plateaus(ISP)를 체계적으로 분석하고, 이들의 발생 메커니즘과 학습 과정에서의 변화를 밝혔다.

    Zunhai Su, Bohan Sun, Xialie Zhuang, Shuibai Zhang, He Xiao

  16. #323LiveAnimate: Stable Long-Form Streaming Human Animation in Real-Time

    LiveAnimate는 14B 파라미터 DiT 기반으로 실시간 스트리밍과 장시간 안정적 생성을 결합한 첫 번째 인간 애니메이션 시스템이다.

    Yuxuan Zhang, Haozhong Xiong, Yubo Huang, Jiayi Song, Jinpeng Yu

  17. #324UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos

    UniSwap은 말하는 영상에서 시각적 외형과 음성을 실시간으로 통합 교체하는 첫 번째 스트리밍 프레임워크이다.

    Yuxuan Zhang, Haozhong Xiong, Jiayi Song, Jinpeng Yu, Yang Shi

  18. #325Full-bandwidth transformer

    Full-bandwidth transformer는 토큰 단위 피드백 대신 전체 히든 상태를 재사용해 추론 성능을 향상시키며, 1.5배 더 많은 토큰으로 학습한 모델과 유사한 결과를 낸다.

    Xi Wang, Ziyang Cai, Zheng Zhan, Harry Dong, Ying Fan

  19. #326Self-Geometry: GT-Free and Plug-and-Play Test-Time Adaptation for Geometrically Consistent 3D Vision Foundation Models

    Self-Geometry는 테스트 시에 2D 픽셀 대응 관계를 활용해 기하학적 일관성을 강제하는 플러그 앤 플레이형 3D 비전 모델 적응 파이프라인이다.

    Seokhyun Youn, Dahyeon Kye, Sung-Ho Bae, Jihyong Oh

  20. #327An AI4AI Framework for Visual Token Pruning

    AutoPrune는 LLM 기반의 시각 토큰 정제 정책을 설계하는 AI4AI 프레임워크로, 94.4%의 토큰 제거에도 99% 이상의 성능을 유지한다.

    Zhen Liu, Wenli Huang, Wei Song, Yuhan Liu, Zhiqin Yang

  21. #330Thought-Level Beam Search for Reasoning

    Gambit는 토큰 소비를 최대 68.5% 절감하면서도 AIME-25에서 +3.3%의 정확도 향상을 달성한 사고 수준 빔 서치 알고리즘입니다.

    Lijie Yang, Hongyin Luo, Jiawei Zhao, Tri Dao, Ravi Netravali

  22. #331OmniScientist: An Omni-Modal Omni-Discipline AI Scientist

    OmniScientist는 다학문적 연구를 이종 원천 데이터에서 직접 수행하는 종단간 다모달 AI 과학자 시스템이다.

    Bobo Li, Hao Fei, Tianjie Ju, Mong-Li Lee, Wynne Hsu

  23. #332Maglev: Sliding Recurrent Memory

    Maglev는 슬라이딩 윈도우 어텐션을 일반화하면서 추론 시 고정 메모리로 작동하는 반복 트랜스포머 구조를 제안한다.

    Bo Liu, Qiang Liu

  24. #333Context-Matched Distillation: Teacher Causality for Autoregressive Video Distillation

    Context-Matched Distillation(CMD)는 자율적 비디오 생성에서 교사-학생 간 정보 불일치를 해결하여 생성 품질과 제어 정확도를 향상시키는 인과적 지도 프레임워크이다.

    Hmrishav Bandyopadhyay, Xuanchi Ren, Zijian Huang, Jay Zhangjie Wu, Tianshi Cao

  25. #334SKILLER: Language-Level Reinforcement Learning for Reusable Skill Extraction in Small Language Models

    SKILLER는 소형 언어 모델에 맞춤형으로 스킬을 생성하는 자연어 기반 강화 학습 프레임워크로, Qwen3.5-9B와 Qwen3.5-4B에서 기존 방법 대비 최대 20.4%의 성능 향상을 달성했다.

    Chenhao Dang, Siyuan Xiong, Conghui He, Weijia Li

  26. #335LycheeMemory V2: Efficient Long-Term Memory for LLM Agents via Semantic Segment-Level Consolidation

    LycheeMemory V2는 세그먼트 단위의 의미 기반 메모리 통합을 통해 LLM 에이전트의 장기 메모리 효율성을 획기적으로 개선한 시스템이다.

    Dongfang Li, Zixuan Liu, Junmai Wang, Jiahe Huang, Fuhao Li

  27. #336Hybrid-Policy Self-Editing for Composable Unstructured Knowledge Editing

    HPSE는 주어진 텍스트를 기반으로 LLM의 지식을 편집하면서도 분해성과 구성성을 동시에 달성하는 새로운 자기-디스틸레이션 기반 편집 방법이다.

    Tianci Liu, Zihan Dong, Tianchun Li, Yi-Chung Chen, Qiming Cao

  28. #337Are You Sure You're Sure? On the Impact of Instruction Tuning on Confidence and Lexical Diversity

    지시 학습은 모델의 답변 신뢰도를 높이지만, 이는 일관된 어휘 다양성 변화와 관련되지 않음을 밝힘.

    Irina Proskurina, Mayank Kumar, Oyindolapo O. Komolafe

  29. #338The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images

    이미지 기반 추론에서 시각적 도구 사용이 실제 답변에 인과적으로 기여하는지 분석한 연구로, 정책 미조정 문제를 밝혀낸다.

    Zhiheng Wang, Bo Peng, Lai Wei, Chaochao Lu

  30. #339Specification-first convergence with an AI coding agent: a case study of dismantling a core architectural invariant across 189 files in a 717k-line codebase with no test oracle and no human code review

    AI 코드 에이전트가 71만 줄 TypeScript 코드베이스에서 핵심 아키텍처 불변식을 3일 동안 2,430달러 비용으로 성공적으로 해체.

    Joel Abenhaim

인기 키워드

reinforcement-learning (331) diffusion-models (190) llm (190) llm-agents (160) video-generation (129) transformer (126) llm-evaluation (125) vision-language (112) vlm (109) long-context (99) large-language-models (94) code-generation (88) long-horizon (86) benchmark-evaluation (82) benchmarking (80) language-models (75) retrieval-augmented (73) flow-matching (68) world-models (68) foundation-models (67)