HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-07-29 featured 논문 30편

  1. #2RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation

    RDT-1B는 이중 팔 조작을 위한 확산 기반 기초 모델로, 1.2B 파라미터와 6K+ 에피소드로 학습하여 제로샷 및 퓨샷 학습 성능을 크게 향상시킨다.

    Songming Liu, Lingxuan Wu, Bangguo Li, Hengkai Tan, Huayu Chen

  2. #3Wavelet Convolutions for Large Receptive Fields

    Wavelet Transform을 활용한 WTConv 레이어로, 과매개변수화 없이 대규모 수용 필드를 구현한다.

    Shahaf E. Finder, Roy Amoyal, Eran Treister, O. Freifeld

  3. #43D-VLA: A 3D Vision-Language-Action Generative World Model

    3D-VLA는 3D 비전-언어-행동 생성 세계 모델로, 2D 기반 VLA 모델의 한계를 극복하고 3D 환경에서의 추론과 행동 계획을 강화한다.

    Haoyu Zhen, Xiaowen Qiu, Peihao Chen, Jincheng Yang, Xin Yan

  4. #5Vista: A Generalizable Driving World Model with High Fidelity and Versatile Controllability

    Vista는 고해상도 예측과 다중 조작 가능성을 갖춘 일반화 가능한 자율 주행 월드 모델로, 기존 모델 대비 55% 개선된 FID 성능을 보인다.

    Shenyuan Gao, Jiazhi Yang, Li Chen, Kashyap Chitta, Yihang Qiu

  5. #6Genie: Generative Interactive Environments

    Genie는 11B 파라미터를 가진 비지도 학습 기반 생성형 상호작용 환경 모델로, 텍스트, 이미지, 스케치 등으로 제어 가능한 가상 세계를 생성한다.

    Jake Bruce, Michael Dennis, Ashley Edwards, Jack Parker-Holder, Yuge Shi

  6. #7GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models

    GSM-Symbolic 벤치마크를 통해 LLM의 수학적 추론 능력 한계를 실증적으로 분석하고, 수치 변화와 불필요한 정보에 대한 취약성을 밝혀냄.

    Iman Mirzadeh, Keivan Alizadeh-Vahid, Hooman Shahrokhi, Oncel Tuzel, Samy Bengio

  7. #8From Generation to Judgment: Opportunities and Challenges of LLM-as-a-judge

    LLM-as-a-judge 패러다임을 통해 기존 평가 방법의 한계를 극복하고, 다양한 NLP 태스크에서 LLM을 활용한 판단과 평가를 체계적으로 정리한다.

    Dawei Li, Bohan Jiang, Liangjie Huang, Alimohammad Beigi, Chengshuai Zhao

  8. #9YOLOv10: Real-Time End-to-End Object Detection

    YOLOv10은 NMS 제거와 효율-정확도 균형 설계를 통해 실시간 엔드투엔드 객체 탐지 성능을 대폭 향상시킨 새로운 YOLO 시리즈이다.

    Ao Wang, Hui Chen, Lihao Liu, Kai Chen, Zijia Lin

  9. #10CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models

    CoT-VLA는 시각적 사고 과정을 통합한 7B 규모의 최신 VLA 모델로, 실제 조작 작업에서 기존 최고 모델 대비 17% 개선된 성능을 보인다.

    Qingqing Zhao, Yao Lu, Moo Jin Kim, Zipeng Fu, Zhuoyang Zhang

  10. #12Scaling Rectified Flow Transformers for High-Resolution Image Synthesis

    고해상도 텍스트-이미지 생성을 위해 Rectified Flow Transformer를 확장한 연구.

    Patrick Esser, Sumith Kulal, A. Blattmann, Rahim Entezari, Jonas Muller

  11. #47Physically Verifiable Evidence and LLM-Based Reporting for Bearing Fault Diagnosis

    안전-critical 시스템에서 신뢰성 있는 AI 진단을 위해 물리적 검증 가능한 증거와 LLM 기반 보고를 결합한 새로운 접근법을 제시한다.

    Yuntong Chen, Jianyu Liu, Guobin Zhao, Ziang Wang, Chao Chen

  12. #304Kimi K3: Open Frontier Intelligence

    Kimi K3는 2.8T 파라미터 MoE 모델로, Kimi K2 대비 2.5배 향상된 확장 효율성을 보인다.

    Kimi Team, Tongtong Bai, Yifan Bai, Yiping Bao, M. C.

  13. #308The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation

    다중 턴 장기 계획 능력을 구조화된 환경에서 3단계로 분석하고, MOPD를 통해 통합하는 방법을 제시한다.

    Tianyi Men, Zhuoran Jin, Kang Liu, Jun Zhao

  14. #309JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents

    JarvisHub는 캔버스 기반의 창의적 에이전트 허브로, 장기적 멀티모달 창작 과정을 관리하고 추적 가능하게 만든다.

    Yunlong Lin, Zixu Lin, Zhaohu Xing, Biqiang Li, Chenxin Li

  15. #312Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation

    On-policy diffusion distillation에서 classifier-free guidance 조건 하의 지도 효과를 개선하기 위해 Positive–Direction Matching(PDM)을 제안한다.

    Bingnan Li, Haozhe Wang, Haozhong Xiong, Fangtai Wu, Jinpeng Yu

  16. #316Codifying the Judge: Scalable Evaluation via Program Distillation

    PAJAMA는 LLM 평가를 프로그램으로 변환하여 비용, 속도, 투명성을 동시에 개선하는 새로운 평가 프레임워크이다.

    Tzu-Heng Huang, Shengqi Qiu, Frederic Sala

  17. #318Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification

    Sol-Attn은 비용 효율적인 동적 어텐션 스파스화를 통해 동영상 생성 추론 속도를 2.1~2.3배 향상시킨다.

    Haopeng Li, Yitong Li, Junsong Chen, Tian Ye, Haozhe Liu

  18. #319OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation

    OmniVAE는 오디오-비디오 생성을 위한 통합 VAE로, 세그먼트 수준 대비 학습과 사전 학습 특징 증류를 통해 다중 모달 대응성을 향상시킨다.

    Jun Zhan, Chen Yang, Yitian Gong, Donghua Yu, Kuangwei Chen

  19. #321Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On

    Oxygen-TryOn은 다양한 의류와 액세서리를 포함한 항목을 정밀하게 시뮬레이션하는 통합 가상 시착 모델로, 기존 시스템보다 뛰어난 일관성과 사실감을 보인다.

    Yong Liu, Xiaolong Fu, Zihang Xu, Wen Xue, Xueheng Li

  20. #324IndicTalk: A Large-Scale Persona-Based Multilingual Conversational Corpus for Indic Languages

    IndicTalk은 인도 언어 대화 자료의 부족을 해결하기 위한 대규모 다국어 코드-믹스 대화 코퍼스이다.

    Sahil Deepak Gawande, Mayank Singh

  21. #328Predicting the Outcome of rTMS Depression Therapy using EEG Signals and CNN

    rTMS 치료 반응 예측을 위해 FBSE-ED 기반 EEG 이미지와 커스텀 CNN을 활용한 연구.

    Wael Korani, Md Fahimul Kabir Chowdhury, Sadam AlQadi, Priyan Malarvizhi kumar, Reza Rostami

  22. #329Evaluating the Impact of Reviewer Guideline Design on LLM-Based Automated Peer Review

    LLM 기반 자동 학술 심사에서 심사 가이드라인 설계가 결과에 미치는 영향을 평가한 연구.

    Haowen Li, Yoichi Ishibashi, M. Oyamada

  23. #330Visible-Light Imaging Diagnosis of Neutral Particle Emission Tomography in the Tokamak Divertor: An Efficient Transformer-based Surrogate Model

    Delta-InvFormer는 EAST 토카막에서 중성입자 방출 톰ограф리 분포를 빠르고 정확하게 재구성하는 Transformer 기반 서러지 모델이다.

    Xiao Wang, Hao Si, Qiang Chen, Yu-Xiang Zhang, Beihe Zhang

  24. #331Multi-Head Latent Control: A Unified Interface for LLM Agent Decision Making

    Multi-Head Latent Control은 기존 LLM을 수정하지 않고도 추론 시점의 제어 결정을 개선하는 경량 레이어를 제안한다.

    Amirhosein Ghasemabadi, Ruichen Chen, Bahador Rashidi, Di Niu

  25. #332TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward

    TILT는 텍스트-이미지 생성 모델에서 복합 조합 프롬프트에 대한 생성을 개선하기 위해 추론 시점에서 모델 고유의 보상 함수를 활용하는 훈련 없이 작동하는 프레임워크이다.

    Debottam Dutta, Jaehoon Hahm, Jianchong Chen, Romit Roy Choudhury

  26. #333dRAE: Representation Autoencoder with Hyper-Spherical Codes

    dRAE는 고차원 시각 표현을 언어 모델과 연결하기 위해 하이퍼스피어리컬 코드를 사용하는 디스크리트 오토인코더로, 코드북 콜랩스 문제를 해결한다.

    Tianren Ma, Lin Long, Chuyan Chen, Mu Zhang, Junbo Zhao

  27. #334IDEAgent: Agentic Quality-Diversity Search for Research Idea Generation

    IDEAgent는 과학적 아이디어 생성을 Quality-Diversity(QD) 탐색으로 모델링한 다중 에이전트 프레임워크로, 32개 주제에서 Yield 지표 기준 3.89배 성능 향상을 보인다.

    Varun Gumma, Navonil Majumder, Soumitra Sinhahajari, Soujanya Poria

  28. #335Reasoning Denoiser: Denoising Reasoning Traces for Hallucination Detection in Large Reasoning Models

    ReDe는 대규모 추론 모델의 추론 트레이스에서 노이즈 단계를 제거하여 환상 생성 감지 성능을 18.69% 향상시키는 학습 프레임워크이다.

    Junlin Fang, Do Nguyen-Thanh, Xiaogang Xu, Zhen Fang, Sean Du

  29. #336Chamaileon: Cross-Context Binder Design with Contextualized Modeling and Mixed Sampling

    Chamaileon은 다중 타겟 및 다중 상태 단백질 결합체 설계를 위한 새로운 프레임워크로, I3CD와 MoPS를 통해 다양한 구조적 맥락에서 유연한 결합체를 생성한다.

    Hengyuan Cao, Shizhuo Cheng, Mingxuan Liu, Weicheng Huang, Yunhong Lu

  30. #337ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding

    ClinFusion은 2D 및 3D 의료 이미지를 통합 처리하는 Vision-Centric MLLM으로, 의료 분야에서 최고 성능을 보인다.

    Hangjie Yuan, Yichen Qian, Zhiwei Tang, Xianzhe Xu, Lirong Wu

인기 키워드

reinforcement-learning (268) llm (153) diffusion-models (144) llm-agents (117) vlm (102) video-generation (95) transformer (90) llm-evaluation (86) vision-language (73) long-context (72) code-generation (63) benchmark-evaluation (62) long-horizon (62) retrieval-augmented (58) large-language-models (56) foundation-models (54) benchmarking (53) text-to-image (53) flow-matching (51) language-models (51)