HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-10-02 featured 논문 30편

  1. #1AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks

    Hongjin Qian, Chaofan Li, Kun Luo, Wenqing Wei, Jianlyu Chen

  2. #2ControlNet++: Improving Conditional Controls with Efficient Consistency Feedback

    Ming Li, Taojiannan Yang, Huafeng Kuang, Jie Wu, Zhaoning Wang

  3. #3Ferret-UI: Grounded Mobile UI Understanding with Multimodal LLMs

    Ferret-UI는 모바일 UI 화면을 정밀하게 이해하고 지시에 따라 행동할 수 있는 다중모달 대형 언어 모델로, GPT-4V보다 기본 UI 작업에서 우수한 성능을 보인다.

    Keen You, Haotian Zhang, E. Schoop, Floris Weers, Amanda Swearngin

  4. #43DGStream: On-the-Fly Training of 3D Gaussians for Efficient Streaming of Photo-Realistic Free-Viewpoint Videos

    3DGStream은 실시간 렌더링과 초당 200프레임(FPS)을 지원하는 3D 가우시안 기반의 실내/실외 동적 장면의 실시간 프리뷰(Free-Viewpoint Video) 스트리밍 기법이다.

    Jiakai Sun, Han Jiao, Guangyuan Li, Zhanjie Zhang, Lei Zhao

  5. #5SpatialTracker: Tracking Any 2D Pixels in 3D Space

    SpatialTracker는 3D 공간에서 2D 픽셀 추적을 수행하여 복잡한 시나리오에서도 정확한 장거리 픽셀 추적을 달성하는 새로운 방법이다.

    Yuxi Xiao, Qianqian Wang, Shangzhan Zhang, Nan Xue, Sida Peng

  6. #6Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference

    Ada-KV는 주의력 헤드별로 적응적 예산을 할당하여 KV 캐시 제거 성능을 향상시키는 최초의 전략이다.

    Yuan Feng, Junlin Lv, Yukun Cao, Xike Xie, S. K. Zhou

  7. #7COLD-Attack: Jailbreaking LLMs with Stealthiness and Controllability

    Xing-ming Guo, Fangxu Yu, Huan Zhang, Lianhui Qin, Bin Hu

  8. #8Masked Diffusion Models are Secretly Time-Agnostic Masked Models and Exploit Inaccurate Categorical Sampling

    마스킹된 확산 모델(MDMs)은 시간 변수와 무관한 마스킹 모델과 동등하며, 범주형 샘플링의 수치적 불안정성으로 인해 성능 평가가 왜곡될 수 있음.

    Kaiwen Zheng, Yongxin Chen, Hanzi Mao, Mingying Liu, Jun Zhu

  9. #9Trial and Error: Exploration-Based Trajectory Optimization for LLM Agents

    Yifan Song, Da Yin, Xiang Yue, Jie Huang, Sujian Li

  10. #10MultiAgentBench: Evaluating the Collaboration and Competition of LLM agents

    Kunlun Zhu, Hongyi Du, Zhaochen Hong, Xiaocheng Yang, Shuyin Guo

  11. #11Text-IF: Leveraging Semantic Text Guidance for Degradation-Aware and Interactive Image Fusion

    Text-IF는 텍스트 유도를 활용해 저품질 이미지 복원과 상호작용 기반 퓨전을 통합한 새로운 이미지 퓨전 모델이다.

    Xunpeng Yi, Han Xu, Hao Zhang, Linfeng Tang, Jiayi Ma

  12. #165Mid-Harness: Scaling Actions Between Model and Harness for Terminal Agents

    Minki Kang, Ryo Hachiuma, Shaokun Zhang, Subhashree Radhakrishnan, Yonggan Fu

  13. #287A Data-Free Physics-Informed Neural Operator for Level-Set Interface Advection

    Muhammad Akbar Khan

  14. #292LoopVL: Recurrent Visual Intelligence

    Zhe Qian, Ziyang Gong, Zhongxing Xu, Hehan Li, Zhonghua Wang

  15. #295EVOKE: Eliciting World Knowledge in Agents for Transferable Decision-Making

    Yuhan Guo, Jinming Liu, Liang Xu, Ziqiang Li, Jianguo Huang

  16. #306UniEvo-VL: An On-policy Self-Distillation Training Recipe for Multimodal Model Self-improvement

    Fang Wu, Da Xing, Yanjie Huang, Junxi Wang, Ji Wang

  17. #307False Frontiers: Diagnosing and Mitigating Co-Cheating in Self-Evolving Search Agents

    Meijia Chen, Hao Li, Zheng Lu, Hongshan Lin, Junbai Tian

  18. #308ATLAS: Aligned Transport of Latent Structure for Reliable World Model Planning

    Ke Fang, Yupu Yao, Lu Cheng

  19. #309MILO: Automated Harness Discovery via Orchestrated Multi-Agent Evolution

    Prithwish Jana, Mononito Goswami, Hao Liu, Xinyu Li, Langlin Huang

  20. #310Rethinking Latent Visual Reasoning: Grounding Latent Reasoning in Visual Evidence

    Xi Xiao, Tianchen Zhao, Youngeun Kim, Zhuowei Li, Linghan Xu

  21. #311LANTERN: Illuminating Hidden Mathematical Knowledge in Language Models

    Pavel Tikhonov, Elena Tutubalina, Ivan Oseledets, Dmitry I. Ignatov, Mikhail Seleznyov

  22. #312Breaking Babel: A Self-Evolving Multi-Agent System for Long-Form Subtitle Translation

    Haibo Jin, Xinjie Li, Najmeh Sadoughi, Yang Liu, Yibo Wang

  23. #313Unmask the State: When Does State Adaptation Matter for Masked Diffusion Language Models

    Injin Kong, Sunghwan Choi, Yohan Jo

  24. #314It's Not What the Image Shows: Irrelevant Context Destabilises VLM Judges Without Informing Them

    Nagham Omar, Mahmoud Jabarin, Kinan Ibraheem, Lotem Peled-Cohen

  25. #315DyRAD: Radar Novel View Synthesis for Dynamic Driving Scenes

    Merav Keidar, Tomer Borreda, Rajalakshmi Nandakumar, Or Litany

  26. #316TERRA: Terrain-Aware Reconstruction, Retargeting and Control for Musculoskeletal Locomotion

    Merkourios Simos, Chengkun Li, Bianca Ziliotto, Alexander Mathis

  27. #317OSWorld-Science: A Benchmark of Computer Use Agents for Learning and Using Scientific Software

    Dingyuan Dai, Heli Qi, Lei Liu, Yinxi Li, Baiding Chen

  28. #318Label-free steering: Compressing test-time reinforcement learning into bias-only subspaces

    Naveen Vakada, Mingyuan Li, Shaoxiong Ji

  29. #319FlashDiffusion: Fused Tiled Kernel Spectral Decomposition

    Julio Candanedo

  30. #320Automated Evaluation of Multi-Turn Dialogues in In-Car Conversational Assistants

    Vaishnav Negi, Lev Sorokin, Soroosh Tayebi Arasteh, Andrea Stocco

인기 키워드

reinforcement-learning (399) diffusion-models (227) llm (217) llm-agents (181) video-generation (157) llm-evaluation (153) transformer (149) vision-language (148) large-language-models (126) long-context (118) vlm (110) code-generation (106) language-models (101) benchmark-evaluation (100) long-horizon (100) benchmarking (97) foundation-models (82) retrieval-augmented (81) world-models (78) chain-of-thought (76)