HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-09-22 featured 논문 30편

  1. #1To Believe or Not to Believe Your LLM

    Yasin Abbasi-Yadkori, Ilja Kuzborskij, András György, Csaba Szepesv'ari

  2. #3HVI: A New Color Space for Low-light Image Enhancement

    Qingsen Yan, Yixu Feng, Cheng Zhang, Guansong Pang, Kangbiao Shi

  3. #4Efficient Deformable ConvNets: Rethinking Dynamic and Sparse Operator for Vision Applications

    Yuwen Xiong, Zhiqi Li, Yuntao Chen, Feng Wang, Xizhou Zhu

  4. #5A Careful Examination of Large Language Model Performance on Grade School Arithmetic

    Hugh Zhang, Jeff Da, Dean Lee, Vaughn Robinson, Catherine Wu

  5. #6BLEnD: A Benchmark for LLMs on Everyday Knowledge in Diverse Cultures and Languages

    Junho Myung, Nayeon Lee, Yi Zhou, Jiho Jin, Rifki Afina Putri

  6. #7MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance

    Yuang Zhang, Jiaxi Gu, Li-Wen Wang, Han Wang, Junqi Cheng

  7. #8HPSv3: Towards Wide-Spectrum Human Preference Score

    Yuhang Ma, Xiaoshi Wu, Keqiang Sun, Hongsheng Li

  8. #9Reasoning with Latent Thoughts: On the Power of Looped Transformers

    Nikunj Saunshi, Nishanth Dikkala, Zhiyuan Li, Sanjiv Kumar, Sashank J. Reddi

  9. #10Disentangling Length from Quality in Direct Preference Optimization

    Ryan Park, Rafael Rafailov, S. Ermon, Chelsea Finn

  10. #11LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images

    Ruyi Xu, Yuan Yao, Zonghao Guo, Junbo Cui, Zanlin Ni

  11. #304BI-Agent and BI-Bench: Towards Automating End-to-End Business Intelligence

    Chuxuan Hu, Yeye He, Penny Zhou, Wee Hyong Tok, Daniel Kang

  12. #306GAVEL: Graph World Models for Verified and Efficient Long-Horizon LLM Task Planning

    Ruiyang Wang, Hao-Lun Hsu, Swarajh Mehta, Jiwoo Kim, Zhihao Dou

  13. #307DeformSmith: Physics Harness-Guided Hierarchical Generation of Deformable Assets for Robot Manipulation

    Can Li, Jie Gu, Zishun Deng, Jingmin Chen, Lei Sun

  14. #309OmniVBench: A Benchmark and Large-Scale Dataset for Omni Reference-to-Video Generation

    Wenxue Li, Peiyan Guan, Haoyang Jiang, Junxian Cai, Hualuo Liu

  15. #311IntBMoE: Integrating Block-Level Conditioning into Expert Composition for Full-Participation Mixture-of-Experts

    Ran Cheng, Longfei Xu, Zheng Liu, Kaikui Liu, Xiangxiang Chu

  16. #312Grounded Skill Synthesis from Code at Scale for Agentic Intelligence

    Yongqi Tong, Pan Wang, Hang Wang, Jianshe Li, Xin Zhang

  17. #313CodeMidas: Scaling Agentic Coding RL Environments from Code Itself

    Bowen Ye, Lei Li, Shicheng Li, Zihao Yue, Linghao Zhang

  18. #314EvoOntology: A Self-Evolving Ontology Layer for Data Agents

    Meiduo Chong, Shaolei Zhang, Ju Fan, Xiaoyong Du

  19. #315From Pretraining to Proficiency: Real-World Subtask RL for Long-Horizon Manipulation with Minimal Human Intervention

    Sichang Su, Benjamin Yang, Zhiyun Deng, Boyuan Liang, Yip Fun Yeung

  20. #316When AI Reviews Train AI Reviewers: Scientific-Judgment Collapse and Mitigation

    Sy-Tuyen Ho, Minghui Liu, Furong Huang

  21. #317RecreationWorld: Scalable and Verifiable Environments for Hybrid Computer-Use Agents

    Shuai Bai, Jiayong Deng, Yikun Fu, Chang Gao, Xuhao Hu

  22. #326When2Think: Learning Difficulty-Aware Length Control for Efficient Hybrid Reasoning Models

    When2Think는 문제 난이도에 따라 추론 깊이를 조절하여 효율적인 하이브리드 추론을 학습하는 포스트-트레이닝 프레임워크이다.

    Jaejun Shim, HyunJin Kim, Young Jin Kim, JinYeong Bak

  23. #327What Does Privileged Information Add to On-Policy Self-Distillation?

    On-policy self-distillation에서 privileged information의 추가 가치를 AMPLE-Math 데이터셋을 통해 분리 평가한 연구.

    XiuYu Zhang, Wei Chow, Junfeng Fang, Zhenkai Liang, Tat-Seng Chua

  24. #328UFO: Chain-of-Evaluation for Omni-Condition Alignment in Multi-Modal Image Generation

    UFO는 다중 조건 일치 평가를 위한 체인형 평가 프레임워크로, 기존 방법 대비 15.25% 높은 인간 평가와의 상관성을 달성했다.

    Danning Zhang, Yijing Lin, Shuhan Zhuang, Mengqi Huang, Shaojin Wu

  25. #329OmniVChat: Synthesizing, Benchmarking, and Training for Native Audio-Visual Dialogue

    Haolin He, Yunfei Chu, Qi Chen, Wen Huang, Yuan Feng

  26. #330Paint-Anything: Unified Any-Color Control for Image Generation and Editing

    Ji Xie, Dewei Zhou, Xinyu Huang, Zhennan Chen, Xun Wang

  27. #331Sample Count Is Not Enough: Candidate-Generation Strategy Shapes the Energy and Performance of LLM Test-Time Scaling

    테스트 타임 스케일링에서 후보 생성 방식이 성능과 에너지 소비에 큰 영향을 미친다.

    Mobina Kashaniyan, Ali Jannesari

  28. #332FAMOS: Feed-Forward 3D Articulation Modeling from Sparse Observations

    FAMOS는 희소한 단일 뷰에서 3D 조인트 모델링을 수행하는 피드포워드 모델로, Multi-state Articulation Transformer와 observed articulation span loss를 통해 정확도를 향상시킨다.

    Kevin Qu, Tao Sun, Massimiliano Viola, Liyuan Zhu, Zhizhuo Zhou

  29. #333Srijika: OpenType-Layout-Reusing Font Restyling for Nine Indic Scripts

    Srijika는 9개의 브라흐미 글꼴 스크립트에 대한 OpenType 레이아웃 재사용 기반 글꼴 리스타일링 시스템이다.

    Anil Pai

  30. #334Learning Foresight without Explicit Trajectories for 3D Diffusion Policies

    Zhongbo Zhang, Zaibin Zhang, Yifan Wang, Changbo Yan, Lijun Wang

인기 키워드

reinforcement-learning (367) diffusion-models (212) llm (210) llm-agents (169) video-generation (146) llm-evaluation (144) transformer (139) vision-language (133) large-language-models (116) long-context (113) vlm (110) code-generation (101) long-horizon (95) benchmark-evaluation (93) language-models (89) benchmarking (87) retrieval-augmented (80) foundation-models (78) world-models (73) flow-matching (72)