HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-07-30 featured 논문 30편

  1. #1INSIDE: LLMs' Internal States Retain the Power of Hallucination Detection

    Chao Chen, Kai Liu, Ze Chen, Yi Gu, Yue Wu

  2. #2Transolver: A Fast Transformer Solver for PDEs on General Geometries

    Haixu Wu, Huakun Luo, Haowen Wang, Jianmin Wang, Mingsheng Long

  3. #3WebThinker: Empowering Large Reasoning Models with Deep Research Capability

    Xiaoxi Li, Jiajie Jin, Guanting Dong, Hongjin Qian, Yutao Zhu

  4. #4Latent Action Pretraining from Videos

    Seonghyeon Ye, Joel Jang, Byeongguk Jeon, Se June Joo, Jianwei Yang

  5. #5JudgeBench: A Benchmark for Evaluating LLM-based Judges

    JudgeBench는 LLM 기반 심사자 평가를 위한 새로운 벤치마크로, 기존 평가 기준보다 훨씬 어려운 과제를 제시한다.

    Sijun Tan, Siyuan Zhuang, Kyle Montgomery, W. Tang, Alejandro Cuadron

  6. #6WorkArena: How Capable Are Web Agents at Solving Common Knowledge Work Tasks?

    Alexandre Drouin, Maxime Gasse, Massimo Caccia, I. Laradji, Manuel Del Verme

  7. #7One-Step Effective Diffusion Network for Real-World Image Super-Resolution

    Rongyuan Wu, Lingchen Sun, Zhiyuan Ma, Lei Zhang

  8. #8Diffusion for World Modeling: Visual Details Matter in Atari

    Eloi Alonso, Adam Jelley, Vincent Micheli, A. Kanervisto, A. Storkey

  9. #9Navigation World Models

    Amir Bar, Gaoyue Zhou, Danny Tran, Trevor Darrell, Yann LeCun

  10. #10TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies

    Ruijie Zheng, Yongyuan Liang, Shuaiyi Huang, Jianfeng Gao, Hal Daum'e

  11. #12HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone

    Simple AI, :, Yuteng Wei, Jinming Ma, Jiawei Wang

  12. #252Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model

    Senqiao Yang, Kaichen Zhang, Zhaoyang Jia, Jinghao Guo, Yifei Shen

  13. #303Kimi K3: Open Frontier Intelligence

    Kimi K3는 2.8T 파라미터 MoE 모델로, Kimi K2 대비 2.5배 향상된 확장 효율성을 보인다.

    Kimi Team, Tongtong Bai, Yifan Bai, Yiping Bao, M. C.

  14. #304Wonder: Video World Model Done Better

    Jiacong Xu, Hanwen Jiang, Zhixin Shu, Kalyan Sunkavalli, Vishal M. Patel

  15. #306Temporal-Distance JEPA: Plan-Aware Representation Learning for Latent World Model Predictive Control

    Jiaxin Bai, Jiaxuan Xiong

  16. #307PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models

    Zichao Lin, Yifeng Xie, Bowen Qu, Haiming Wang, Jia Li

  17. #308The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation

    다중 턴 장기 계획 능력을 구조화된 환경에서 3단계로 분석하고, MOPD를 통해 통합하는 방법을 제시한다.

    Tianyi Men, Zhuoran Jin, Kang Liu, Jun Zhao

  18. #309JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents

    JarvisHub는 캔버스 기반의 창의적 에이전트 허브로, 장기적 멀티모달 창작 과정을 관리하고 추적 가능하게 만든다.

    Yunlong Lin, Zixu Lin, Zhaohu Xing, Biqiang Li, Chenxin Li

  19. #310A New Role for Relevance: Guiding Corpus Interaction in Agentic Search

    Jiangnan Li, Yuqing Li, Mo Yu, Jinchao Zhang, Jie Zhou

  20. #311Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation

    On-policy diffusion distillation에서 classifier-free guidance 조건 하의 지도 효과를 개선하기 위해 Positive–Direction Matching(PDM)을 제안한다.

    Bingnan Li, Haozhe Wang, Haozhong Xiong, Fangtai Wu, Jinpeng Yu

  21. #312ReDesign: Recovering Editable Design Structures from Images via Agentic Decomposition

    Jooyeol Yun, Jintae Park, Hyesu Lim, Junha Hyung, Hyungjin Chung

  22. #313VisualPatchWorld: Code World Models as Latent Structured Representations for Planning

    Jiaxin Bai, Jiaxuan Xiong

  23. #314Codifying the Judge: Scalable Evaluation via Program Distillation

    PAJAMA는 LLM 평가를 프로그램으로 변환하여 비용, 속도, 투명성을 동시에 개선하는 새로운 평가 프레임워크이다.

    Tzu-Heng Huang, Shengqi Qiu, Frederic Sala

  24. #315Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification

    Sol-Attn은 비용 효율적인 동적 어텐션 스파스화를 통해 동영상 생성 추론 속도를 2.1~2.3배 향상시킨다.

    Haopeng Li, Yitong Li, Junsong Chen, Tian Ye, Haozhe Liu

  25. #316Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On

    Oxygen-TryOn은 다양한 의류와 액세서리를 포함한 항목을 정밀하게 시뮬레이션하는 통합 가상 시착 모델로, 기존 시스템보다 뛰어난 일관성과 사실감을 보인다.

    Yong Liu, Xiaolong Fu, Zihang Xu, Wen Xue, Xueheng Li

  26. #317CodeNib: A Multi-View Data System for Serving Repository Context to Coding Agents

    Zhongming Yu, Hengjia Yu, Boqin Yuan, Shuting Zhao, Yizhao Chen

  27. #318Keep It InMind: Benchmarking the Implicit-Association Blind Spot in Agent Memory

    Ruizhe Li, Mingxuan Du, Benfeng Xu, Zhendong Mao

  28. #319Pass the Baton: Trajectory-Relayed On-Policy Distillation

    Haolei Xu, Xiaowen Xu, Haiwen Hong, Zixuan Ni, Hongxing Li

  29. #320Novel Claim or Déjà Vu? Rethinking "Contamination-Free'' Dynamic Evaluation for Multimodal Automated Fact-Checking

    Haorui He, Xinwen Chen, Dacheng Wen, Reynold Cheng, Francis C. M. Lau

  30. #321Shieldstral

    Antonia Calvi, Avinash Sooriyarachchi, Giada Pistilli, Guillaume Lample, Maarten Buyl

인기 키워드

reinforcement-learning (269) llm (154) diffusion-models (147) llm-agents (117) vlm (102) video-generation (96) transformer (91) llm-evaluation (88) vision-language (73) long-context (72) code-generation (64) benchmark-evaluation (63) long-horizon (62) retrieval-augmented (58) large-language-models (56) foundation-models (55) benchmarking (53) text-to-image (53) flow-matching (51) language-models (51)