HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-10-09 featured 논문 30편

  1. #1Uncertainty Quantification and Confidence Calibration in Large Language Models: A Survey

    LLM에서 불확실성 양화(UQ)의 중요성과 기존 방법의 한계를 분석하고, 새로운 분류체계를 제시한 조사 논문.

    Xiaoou Liu, Tiejin Chen, Longchao Da, Chacha Chen, Zhen-Yu Lin

  2. #2PhyScene: Physically Interactable 3D Scene Synthesis for Embodied AI

    PhyScene은 물리적 상호작용을 고려한 3D 장면 생성을 위한 조건부 확산 모델 기반의 새로운 방법이다.

    Yandan Yang, Baoxiong Jia, Peiyuan Zhi, Siyuan Huang

  3. #3A Vehicle-Integrated Approach to Digital Twin Deployment for Bridges Through Drive-By Sensing

    Zihao Liu, Daigo Kawabe, Jiaji Wang, Chul-Woo Kim, Mehrisadat Makki Alamdari

  4. #4The pitfalls of next-token prediction

    Next-token prediction이 인간 지능을 충분히 모델링하지 못할 수 있음을 밝히고, teacher-forcing의 한계를 실증적으로 분석한다.

    Gregor Bachmann, Vaishnavh Nagarajan

  5. #5Flow Q-Learning

    Flow Q-Learning(FQL)은 복잡한 행동 분포를 모델링하는 flow policy를 활용한 오프라인 강화학습 방법으로, 73개의 OGBench 및 D4RL 태스크에서 우수한 성능을 보인다.

    Seohong Park, Qiyang Li, Sergey Levine

  6. #6Agent-as-a-Judge: Evaluate Agents with Agents

    Agent-as-a-Judge를 제안하며, DevAI 벤치마크에서 90%의 인간 평가자와 일치율을 보임.

    Mingchen Zhuge, Changsheng Zhao, Dylan R. Ashley, Wenyi Wang, Dmitrii Khizbullin

  7. #7Multi-agent Architecture Search via Agentic Supernet

    MaAS는 다중 에이전트 시스템의 자동 설계를 위한 확률적 아키텍처 분포인 agentic supernet을 최적화하여, 다양한 쿼리에 맞춤형으로 자원을 할당하고 성능을 향상시킨다.

    Gui-Min Zhang, Luyang Niu, Junfeng Fang, Kun Wang, Lei Bai

  8. #8Spike-driven Transformer V2: Meta Spiking Neural Network Architecture Inspiring the Design of Next-generation Neuromorphic Chips

    Meta-SpikeFormer는 ImageNet-1K에서 80.0% 정확도를 달성한 첫 Transformer 기반 SNN이며, CNN 기반 SNN 대비 3.7% 개선된 성능을 보인다.

    Man Yao, Jiakui Hu, Tianxiang Hu, Yifan Xu, Zhaokun Zhou

  9. #9HUGS: Holistic Urban 3D Scene Understanding via Gaussian Splatting

    HUGS는 3D 가우시안 스플래팅을 활용해 도시 장면의 기하, 외관, 의미, 운동을 통합 최적화하는 실시간 렌더링 파이프라인을 제안한다.

    Hongyu Zhou, Jiahao Shao, Luxiao Xu, Dongfeng Bai, Weichao Qiu

  10. #10FinBen: A Holistic Financial Benchmark for Large Language Models

    FinBen은 금융 분야 대형 언어 모델 평가를 위한 최초의 종합적 오픈소스 벤치마크로, 24개 금융 태스크와 36개 데이터셋을 포함한다.

    Qianqian Xie, Weiguang Han, Zhengyu Chen, Ruoyu Xiang, Xiao Zhang

  11. #11InfLLM: Training-Free Long-Context Extrapolation for LLMs with an Efficient Context Memory

    InfLLM은 추가 학습 없이 기존 LLM이 긴 시퀀스를 처리할 수 있도록 돕는 메모리 기반의 훈련 없는 방법이다.

    Chaojun Xiao, Pengle Zhang, Xu Han, Guangxuan Xiao, Yankai Lin

  12. #38Long-WAM: Scaling the Context of World-Action Models

    Wei Huang, Bohan Zhang, Chenzhi Liu, Isabella Liu, Shuai Yang

  13. #303WorldSonus: Bringing Sound to Worlds

    Pengjun Fang, Jingyi Fa, Kam Man Wu, Jiaming Wang, Haoyuan Huang

  14. #304RobotWorld: Benchmarking Multimodal Agents for Robot Use Across Diverse Tasks and Embodiments

    Zhiqin Yang, Chenxin Li, Xiaomeng Hu, Yibin Liu, Weidong Huang

  15. #305Rethinking World-Action Model for Compositional and In-Context Robotic Manipulation

    Shukai Gong, Xuanran Zhai, Yintianrun Zhang, Ruopeng Cui, Ye Huang

  16. #306PhysEvo: Astra Can Act, Let It

    Wenqing Tian, Zeyu Zhang, Zhaocheng Liu, Fengwei Liu, Qiang Liu

  17. #307STEPQuant: When and Where Errors Matter in Delta-Rule Recurrent State Quantization

    Bingchen Yao, Haobo Xu, Haokun Lin, Yichen Wu, Ziyu Guo

  18. #308Recursive Game Creator: An Agentic Product-Level Experience-Oriented Game Harness

    Jiajun Chen, Haoyu Wu, Mingda Jia, Xihui Liu

  19. #309DecepEval: A Benchmark for Evaluating Deception in LLM Agents

    DecepEval은 LLM 에이전트의 사기성 행동을 평가하기 위한 벤치마크로, 3가지 작업군과 28개 전문 시나리오에서 1,532개 인스턴스를 포함한다.

    Yiming Xu, Hongyue Yu, Beihua Yang, Zihan Chen, Yixin Liu

  20. #310GRACE: Generation-aware latent compression for efficient video generation

    Jiyoung Kim, Paul Hyunbin Cho, Jisu Nam, Donghoon Lee, Hyunsung Go

  21. #311A self-learning scientific agent for X-ray diffraction

    Bin Cao, Huichi Zhou, Runyu Yang, Jingsong Li, Shuchen Sun

  22. #312PanoPed: Beyond Bounding Boxes for Sim-to-Real Panoramic Pedestrian Tracking

    Qinfeng Zhu, Weiguang Zhao, Yunxi Jiang, Anh Nguyen, Lei Fan

  23. #313VepAgent: Bridging Causal-Transition via Tool-Augmented Reinforcement Learning for Video Event Prediction

    Qiutong Chen, Yuchan Guo, Zhenlong Yuan, Haobo Yang, Fangfang Lin

  24. #314SGF+: Decoupling Gradient Flows for Autoregressive Video Generation

    Zihan Su, Junhao Zhuang, Yaowei Li, Siwen Lu, Haoran Li

  25. #315UniWAM: Unified World-Action Model

    UniWAM은 언어-비주얼-액션 통합 학습을 통해 물리적 세계 이해, 시각 생성, 액션 예측을 동시에 수행하는 새로운 통합 아키텍처이다.

    Wenxuan Song, Jiayi Chen, Jingbo Wang, Shuai Zhou, Xicheng Gong

  26. #316UltraText Bench: A Comprehensive Bilingual Benchmark for Evaluating Visual Text Rendering in Image Generation

    Deyuan Liu, Yihao Hu, Jingxuan Zhang, Xingying Li, Jun Xie

  27. #317Semifactual Credit-Augmented Policy Optimization

    Junshu Pan, Zhizhang Fu, Shulin Huang, Yiran Ding, Zifan Cheng

  28. #318Tetris3D: 3D Scene Generation With Objects That Fit Together

    Jaeyeong Kim, Jinhyuk Jang, Jongmin Lee, Kyehong Park, Seungryong Kim

  29. #319RunningTab: Direct Workspace Interaction with Environment-Side Tabs

    Jinheon Baek, Soyeong Jeong, Yumin Choi, Dongsu Han, Sung Ju Hwang

  30. #320Gains and Collapse in On-Policy Distillation:A Reinforcement Learning Perspective

    Han Cui, Jianhao Yan, Yun Luo, Hongbo Zhang, Zhizhang Fu

인기 키워드

reinforcement-learning (411) diffusion-models (234) llm (225) llm-agents (187) video-generation (166) vision-language (159) llm-evaluation (158) transformer (153) large-language-models (140) long-context (123) code-generation (113) vlm (112) language-models (107) long-horizon (105) benchmark-evaluation (102) benchmarking (101) foundation-models (84) retrieval-augmented (83) chain-of-thought (82) world-models (81)