HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-10-11 featured 논문 30편

  1. #1Memento 3: Model-Based Recursive Self-Improvement through Reflective Rulebooks

    Memento 3는 자연어 규칙집을 기반으로 환경 모델을 학습하고 이를 코드로 변환하여 반복적으로 개선하는 모델 기반 자기 개선 프레임워크이다.

  2. #2InFoBench: Evaluating Instruction Following Ability in Large Language Models

    InFoBench는 LLM의 지시사항 따르기 능력을 평가하기 위한 새로운 메트릭 DRFR과 500개의 지시사항을 포함한 벤치마크를 제시한다.

    Yiwei Qin, Kaiqiang Song, Yebowen Hu, Wenlin Yao, Sangwoo Cho

  3. #3Multi-Agent Egocentric World Model with Fine-Grained Embodied Interaction

    ME-World는 다중 에이전트가 공유 환경에서 상호작용하는 상황에서 일관된 에고 스트림을 생성하는 다중 에이전트 에고 월드 모델이다.

  4. #4U-Space: Uncovering When and Why Uncertainty Arises in Language Models

    U-Space는 언어 모델의 추론 과정에서 발생하는 불확실성을 측정하고 해석할 수 있도록 설계된 저차원 공간과 U-Lens를 제시한다.

  5. #5MAGIS: LLM-Based Multi-Agent Framework for GitHub Issue Resolution

    MAGIS는 GitHub 이슈 해결을 위한 LLM 기반 멀티에이전트 프레임워크로, GPT-4 대비 8배 높은 해결률을 달성했다.

    Wei Tao, Yucheng Zhou, Wenqiang Zhang, Yu-Xi Cheng

  6. #6GPT-4V(ision) is a Human-Aligned Evaluator for Text-to-3D Generation

    GPT-4V를 활용해 텍스트-3D 생성 모델의 인간 정렬 평가 메트릭을 구축하고, Elo 점수를 통해 모델을 자동 평가하는 시스템을 제안한다.

    Tong Wu, Guandao Yang, Zhibing Li, Kai Zhang, Ziwei Liu

  7. #7CycleNet: Enhancing Time Series Forecasting through Modeling Periodic Patterns

    CycleNet은 주기적 패턴을 명시적으로 모델링하여 장기 시계열 예측 성능을 향상시키는 간단하면서도 강력한 방법이다.

    Shengsheng Lin, Weiwei Lin, Xinyi Hu, Wentai Wu, Ruichao Mo

  8. #8Learning Smooth and Expressive Interatomic Potentials for Physical Property Prediction

    eSEN이라는 새로운 MLIP 모델이 에너지 보존 능력을 기반으로 물리적 성질 예측 성능을 SOTA 수준으로 향상시킨다.

    Xiang Fu, Brandon M. Wood, Luis Barroso-Luque, Daniel S. Levine, Meng Gao

  9. #9ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models

    ProRL은 KL divergence 제어와 reference policy reset을 통해 기존 모델 분포를 벗어난 새로운 추론 전략을 발견하는 장기 강화학습 방법이다.

    Mingjie Liu, Shizhe Diao, Ximing Lu, Jian Hu, Xin Dong

  10. #10T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT

    T2I-R1은 강화 학습 기반의 이중 수준 CoT를 도입하여 텍스트-이미지 생성 성능을 13~19% 향상시킨 모델이다.

    Dongzhi Jiang, Ziyu Guo, Renrui Zhang, Zhuofan Zong, Hao Li

  11. #11Generalizing Verifiable Instruction Following

    IFBench라는 새로운 벤치마크를 제시하며, RLVR 기반 학습이 정밀 지시사항 준수 성능을 15% 이상 향상시킨다.

    Valentina Pyatkin, Saumya Malik, Victoria Graf, Hamish Ivison, Shengyi Huang

  12. #12LLM Maybe LongLM: Self-Extend LLM Context Window Without Tuning

    SelfExtend는 미세조정 없이 기존 LLM의 컨텍스트 윈도우를 확장하는 새로운 방법으로, 그룹 어텐션과 이웃 어텐션을 기반으로 한다.

    Hongye Jin, Xiaotian Han, Jingfeng Yang, Zhimeng Jiang, Zirui Liu

  13. #13Windows Agent Arena: Evaluating Multi-Modal OS Agents at Scale

    Windows Agent Arena는 Windows OS 내에서 다중 모달 에이전트를 대규모로 평가하는 벤치마크 환경으로, Navi 에이전트의 성능을 19.5%의 성공률로 평가한다.

    Rogerio Bonatti, Dan Zhao, Francesco Bonacci, Dillon Dupont, Sara Abdali

  14. #53Foundations of Large Language Models

    BERT 모델의 기본 아키텍처와 하이퍼파라미터 설정을 설명하며, LLM 개발의 기초를 다룬다.

  15. #291A GPU-Parallel Framework for Heterogeneous Multi-Task Reinforcement Learning

    Hebero는 GPU-병렬 환경에서 이질적 다중 작업 강화 학습을 위한 벤치마크와 DGPO 알고리즘을 제시하여 90.1%의 성공률을 달성한다.

  16. #306MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement

    MiMo-V2.6은 대규모 강화학습을 통해 모델 스스로를 개선하는 방향으로 확장한 다모달 강화학습 프레임워크이다.

  17. #307WorldGuide: Goal-Directed Video World Model for Procedural Task Execution

    WorldGuide는 시각적 세계 공간에서 닫힌 루프 태스크 실행을 통해 절차적 동영상 생성을 수행하는 모델로, WorldGuide-Bench에서 33.33%의 태스크 성공률을 달성했다.

  18. #308SPW-Nav: A Streaming Panoramic World Model for Language-Guided Navigation

    SPW-Nav는 언어 지시에 따라 2K 해상도 360° 영상을 실시간 스트리밍하는 세계 모델로, 26.6 FPS 속도로 1분 동안 연속 생성한다.

  19. #309OuroWorld: Bringing Any 3D World Alive as Diverse, Endlessly Looping 3D Cinemagraphs

    OuroWorld는 3D Gaussian Splatting 장면을 마스크 없이 루프되는 3D 씨네그래프로 변환하는 프레임워크로, 39개 장면에서 70.8%–99.0% 사용자 선호도를 달성했다.

  20. #310Beyond Spatio-Temporal Priors: A Generalizable Approach for Dense Correspondence Matching

    FreeMatching은 기존의 시공간 가정을 벗어난, IEG 환경에서도 정확한 신원 보존 대응을 가능하게 하는 일반화된 대응 매칭 프레임워크이다.

  21. #311MC-Sparse: Deconstructing and Closing the Dense-Sparse Attention Gap in Diffusion Transformers

    MC-Sparse는 토큰 수준의 정밀한 어텐션 선택과 타일 정렬 그룹핑을 결합한 훈련 없이 가능한 확산 트랜스포머 가속 프레임워크로, 1.80×~2.32×의 가속 성능을 보인다.

  22. #312TestPrism: Rethinking Test Evaluation Beyond a Single Reference

    TestPrism은 단일 참조 기반 테스트 평가의 한계를 극복하기 위해 300개 테스트 태스크와 3000개 후보 구현을 포함한 새로운 평가 프레임워크를 제시한다.

  23. #313Synthesis Through Simulation: Generating Coherent Enterprise Data via Scalable Agent-System Interaction

    STS는 정책 강제 API를 활용한 시뮬레이션 기반 데이터 생성으로, 10개 기업 환경에서 100% 제약 만족과 0.88 평균 마진 페르미티를 달성한 도메인 비특화 에이전트 GP를 제시한다.

  24. #314Post-Training Frontier Text-to-Image Models by Composing Preference and Rubric Rewards

    이 연구는 선호도와 기준 기반 보상 신호를 결합한 후학습 전략을 통해 텍스트-이미지 생성 모델의 성능을 개선한다.

  25. #315OneSearch-VL: Unified Multimodal Deep Research Agent for Image and Video

    OneSearch-VL은 단일 이미지, 다중 이미지, 동영상의 딥 리서치를 통합하는 새로운 에이전트로, VGEG 기반 데이터 엔진과 EVGR 보상을 통해 성능을 크게 향상시킨다.

  26. #316Pumpire: Unified Benchmark for Metric Distance Estimation

    Pumpire는 3D 기초 모델의 점-점 거리 추정 능력을 직접 평가하는 통합 벤치마크로, 6,400개의 실제 장면 데이터와 29개 기준 모델 실험을 통해 정확도를 분석한다.

    Siyu Chen, Zehan Wang, Jiayang Xu, Yihan Wu, Jialei Wang

  27. #317Embodied Turing Machines: Stateful Code for Robot Recursive Self-Improvement

    COAP는 로봇 정책을 코드로만 구현하여 재귀적 자기 개선(RSI)을 가능하게 하는 새로운 패러다임이다.

    Kairui Hu, Siyuan Hu, Fangzhou Hong, Zhaoxi Chen, Ziwei Liu

  28. #318SparseEngine: Sparse-First Inference Engine

    SparseEngine는 다양한 스파스 인퍼런스 메서드를 통합한, 키-벨류 캐시 관리와 높은 처리 성능을 제공하는 스파스-퍼스트 인퍼런스 엔진이다.

  29. #319OmniCapBench: A Deep-Structured Evaluation Framework for Fine-Grained Audio-Visual Captioning

    OmniCapBench는 MLLM의 오디오-비주얼 캡션 생성 능력을 세부적으로 평가하기 위한 딥-스트럭처드 평가 프레임워크로, 786개의 밀집 어노테이션 영상과 세 가지 평가 트랙을 통해 구조적 정확도와 세부적 의미 정확도를 분리 평가한다.

  30. #320Do LLMs Understand Sequential Structure? A Controlled Study of Inference and Generation

    LLMs가 표면 행동 통계 이상의 순차 구조를 이해하는지 실험적으로 검증한 연구.

    Jerry Wang, Zhengxiang Wang, Ting Yu Liu, Hsin-Ling Hsu, Yi-Cheng Lai

인기 키워드

reinforcement-learning (417) diffusion-models (235) llm (227) llm-agents (190) video-generation (170) llm-evaluation (162) vision-language (160) transformer (154) large-language-models (144) long-context (125) code-generation (115) vlm (112) language-models (109) long-horizon (107) benchmark-evaluation (103) benchmarking (103) foundation-models (84) retrieval-augmented (84) chain-of-thought (83) world-models (82)