HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-10-12 featured 논문 30편

  1. #1Toward Generalist Anomaly Detection via In-Context Residual Learning with Few-Shot Sample Prompts

    InCTRL은 few-shot 정상 이미지를 기반으로 잔차를 학습하여 다양한 도메인의 이상 탐지를 일반화하는 새로운 GAD 모델이다.

    Jiawen Zhu, Guansong Pang

  2. #2AHA: A Vision-Language-Model for Detecting and Reasoning Over Failures in Robotic Manipulation

    AHA는 시각-언어 모델을 활용해 로봇 조작 실패를 탐지하고 추론하는 시스템으로, 실패 데이터셋 AHA와 FailGen을 통해 21.4% 성공률 향상.

    Jiafei Duan, Wilbert Pumacay, Nishanth Kumar, Y. Wang, Shulin Tian

  3. #4ReNoise: Real Image Inversion Through Iterative Noising

    ReNoise는 반복적인 노이징을 통해 확산 모델의 역추적 정확도를 향상시키는 이미지 역추적 기법이다.

    Daniel Garibi, Or Patashnik, Andrey Voynov, Hadar Averbuch-Elor, Daniel Cohen-Or

  4. #8Lotus: Diffusion-based Visual Foundation Model for High-quality Dense Prediction

    Lotus는 기존 디퓨전 모델의 단점을 개선한 고정밀 밀집 예측 기반 시각 기초 모델로, 단계 수를 줄이고 노이즈 예측 대신 직접 어노테이션 예측을 통해 성능과 효율성을 동시에 향상시킨다.

    Jing He, Haodong Li, Wei Yin, Yixun Liang, Leheng Li

  5. #9WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning

    WebAgent-R1은 다중 턴 웹 에이전트 학습을 위한 엔드투엔드 강화학습 프레임워크로, WebArena-Lite 벤치마크에서 Llama-3.1-8B의 성공률을 44.8%까지 끌어올렸다.

    Zhepei Wei, Wenlin Yao, Yao Liu, Weizhi Zhang, Qin Lu

  6. #10Context Length Alone Hurts LLM Performance Despite Perfect Retrieval

    긴 입력 길이 자체가 LLM의 성능을 저하시키며, 이는 단순한 검색 실패와 무관하다.

    Yufeng Du, Minyang Tian, S. Ronanki, Subendhu Rongali, S. Bodapati

  7. #11RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text Detectors

    RAID는 기계 생성 텍스트 탐지기의 강건성을 평가하기 위한 최대 규모의 벤치마크 데이터셋이다.

    Liam Dugan, Alyssa Hwang, Filip Trhlík, Josh Magnus Ludan, Andrew Zhu

  8. #12How do Large Language Models Handle Multilingualism?

    LLMs는 다국어 처리를 영어로 변환-이해-생성하는 3단계 워크플로우(MWork)를 통해 수행하며, PLND를 통해 검증하고 언어별 정밀 조정이 가능하다.

    Yiran Zhao, Wenxuan Zhang, Guizhen Chen, Kenji Kawaguchi, Lidong Bing

  9. #13On the Effects of Data Scale on UI Control Agents

    UI 컨트롤 에이전트의 성능이 데이터 규모에 어떻게 영향을 받는지 AndroidControl 데이터셋을 통해 분석한 연구.

    Wei Li, Will Bishop, Alice Li, Christopher Rawles, Folawiyo Campbell-Ajala

  10. #14OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding

    OMG-LLaVA는 단일 모델로 이미지, 객체, 픽셀 수준의 추론과 이해를 통합한 MLLM으로, 1개의 LLM, 1개의 인코더, 1개의 디코더로 다양한 비주얼-텍스트 작업을 수행한다.

    Tao Zhang, Xiangtai Li, Hao Fei, Haobo Yuan, Shengqiong Wu

  11. #310REMORY: Learning Residual Memory for Context Compaction

    Hanchen Xia, Baoyou Chen, Yutang Ge, Naihao Deng, Senqiao Yang

  12. #315Evaluating the Transfer of Co-Evolved Communication from 2D to 3D Simulation

    2D 시뮬레이터에서 진화한 로봇 간의 공동 통신 메커니즘이 3D 물리 시뮬레이터로 전이되었을 때의 성능 변화를 분석한다.

    Fernando Montes-Gonzalez

  13. #317Embodied Turing Machines: Stateful Code for Robot Recursive Self-Improvement

    COAP는 로봇 정책을 코드로만 구현하여 재귀적 자기 개선(RSI)을 가능하게 하는 새로운 패러다임이다.

    Kairui Hu, Siyuan Hu, Fangzhou Hong, Zhaoxi Chen, Ziwei Liu

  14. #318Pumpire: Unified Benchmark for Metric Distance Estimation

    Pumpire는 3D 기초 모델의 점-점 거리 추정 능력을 직접 평가하는 통합 벤치마크로, 6,400개의 실제 장면 데이터와 29개 기준 모델 실험을 통해 정확도를 분석한다.

    Siyu Chen, Zehan Wang, Jiayang Xu, Yihan Wu, Jialei Wang

  15. #321Opera: A Verbal Critic Framework for Long-horizon Coding Agents

    Opera는 장기적 코드 생성 작업에서 지속적인 피드백을 관리하는 언어 기반 크리틱 프레임워크로, 테스트 시 15.0%까지 해결률을 향상시킨다.

    Kai Mei, Zhiyuan Hu, Yutong Dai, Juntao Tan, Yifan Zhang

  16. #322Do LLMs Understand Sequential Structure? A Controlled Study of Inference and Generation

    LLMs가 표면 행동 통계 이상의 순차 구조를 이해하는지 실험적으로 검증한 연구.

    Jerry Wang, Zhengxiang Wang, Ting Yu Liu, Hsin-Ling Hsu, Yi-Cheng Lai

  17. #323ReSPO: Reshaped Sequence Policy Optimization for Gradient Starvation in Off-Policy Learning

    ReSPO는 off-policy 학습에서 발생하는 gradient starvation 문제를 해결하기 위해 α-divergence 기반의 sequence-level kernel을 도입한 새로운 정책 최적화 방법이다.

    Yihang Chen, Yuanhao Ban, Cho-Jui Hsieh

  18. #324Mara Chain: Rethinking Failure as a Stepping Stone for AI System Auto-Evolution

    Mara Chain은 거부된 후보를 반복적으로 개선함으로써 AI 시스템 최적화 성능을 20.5%까지 향상시키는 새로운 절차를 제시한다.

    Yubin Lyu, Fu Li, Jiawei Fei, Yang Zhao, Weixing Mei

  19. #325MIRA: A Musical Intent Refinement Agent for Aligning Text-to-Music Generation with User Intent

    MIRA는 사용자 의도와 음악 생성을 정렬하기 위해 MuRA-Bench 기반의 검증 가능한 루비릭 항목을 사용하는 테스트 시점 에이전트다.

    Zekai Liu, Zhilin Wang, Xuzheng He, Yu Cheng, Yang Yang

  20. #326Can AI Agents Make Open-Ended Scientific Discovery? Evidence from Station

    Station은 Supervisor와 Meta Reflection을 통해 62.7%의 과학적 발견을 자율적으로 재현하는 다중 에이전트 연구 환경이다.

    Wenyu Du, Stephen Chung

  21. #327A Closer Look at Agentic BBO: Benchmarking LLM Agents for Black-Box Optimization

    AgenticBBO-Bench를 통해 LLM 에이전트의 BBO 성능을 다분야 비교하고, 핵심 성능 요인을 분석한 연구.

    Ming Chen, Rong-Xi Tan, Ke Xue, Yu-Jie Zhou, Taiye Lu

  22. #328SpaceFlow: Locally Controllable 3D Generation

    SpaceFlow는 3D 생성 시 지역적 제어를 가능하게 하는 훈련 없이 사용할 수 있는 프레임워크로, 지역별 기하학적 제약과 외관 조건을 독립적으로 적용한다.

    Neil De La Fuente, Joan Lafuente, Mukhammadali Sayfiddinov, Felicia Scharitzer, Marc Pollefeys

  23. #329Accurate but Not Humble: Evaluating Epistemic Humility in LLM Agents under Knowledge Conflict

    LLM 에이전트가 지식 충돌 상황에서 겸손하게 불확실성을 인식하고 전달하는 능력을 평가하는 새로운 프레임워크를 제안한다.

    Kaiser Sun, Bernal Jimenez Gutierrez, Hongjun Liu, Jingyu Zhang, Jie Gao

  24. #330Distilling Routed 3D Privilege for Spatial Reasoning in Vision-Language Models

    GPD는 3D 정보를 질문에 조건화된 방식으로 활용해 시공간 추론 능력을 향상시키는 RGB-only VLM 학습 프레임워크이다.

    Hongxing Li, Yixin Li, Dingming Li, Zixuan Wang, Yuchen Yan

  25. #332SpecFold: Folding Multi-Branch Redundancy for Faster Speculative Decoding in Diffusion Language Models

    SpecFold는 다중 분기 추측 디코딩에서 계산 중복성을 활용해 디퓨전 언어 모델의 처리 속도를 최대 1.99배 향상시키는 알고리즘-시스템 협력 설계이다.

    Chung-En Ho, Weiyu Sun, Cheng-Jhih Shih, He Li, Yong Liu

  26. #333Incremental Open-Ended Deep Research with Structured Harness

    Incremental-OEDR은 기존 연구 보고서를 기반으로 새로운 정보를 반영해 효율적으로 업데이트하는 시스템으로, DeepResearch Bench에서 ROUGE-L F1 0.51, EM F1 0.63 개선을 기록했다.

    Meilin Chen, Hongyuan Bao

  27. #334One Block, Multiple Depths: Recurrent Vision Transformers with Depth-Programmed Experts

    reViT은 단일 Transformer 블록을 반복 적용하여 ViT의 전체 깊이 성능을 유지하면서 파라미터 수를 73% 줄인다.

    Adrian Bulat, Yassine Ouali, Georgios Tzimiropoulos

  28. #335CARE: Certifying Acceleration for Vision-Language-Action Inference

    CARE는 VLA 모델 가속화 시 발생할 수 있는 실패를 인증하면서 최대 10.8× 가속을 보장하는 정량적 접근법이다.

    Rui Liu, Tong Zheng, Jindong Gu, Zhipeng Wang

  29. #336BrickBench: Evaluating Agentic Brick Design

    BrickBench는 텍스트 조건에 기반한 에이전트 기반 레고 세트 설계를 평가하는 벤치마크로, 설계의 유효성, 정렬, 디자인 품질을 측정한다.

    Peter Kulits, Yiqing Xu, R. Kenny Jones, Cordelia Schmid, Jiajun Wu

  30. #337Incidental information contaminates patient notes and disrupts clinical reasoning in large language models

    대규모 언어 모델(LLM)이 임상 기록과 추론 과정에서 부수적 정보에 민감하게 반응하여 의료 오류를 유발할 수 있음을 밝힘.

    Krithik Vishwanath, Brandon Ye, Anton Alyakin, John E. Markert, Aaron Hsieh

인기 키워드

reinforcement-learning (420) diffusion-models (237) llm (229) llm-agents (192) video-generation (170) llm-evaluation (162) vision-language (162) transformer (154) large-language-models (146) long-context (126) code-generation (115) vlm (112) language-models (109) long-horizon (108) benchmark-evaluation (103) benchmarking (103) retrieval-augmented (85) chain-of-thought (84) foundation-models (84) world-models (82)