HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-07-27 featured 논문 24편

  1. #15OpenForgeRL: Train Harness-native Agents in Any Environment

    OpenForgeRL은 다양한 환경에서 하네스 기반 에이전트를 end-to-end로 학습할 수 있는 오픈소스 프레임워크로, 31.7 pass³ 등 여러 벤치마크에서 기존 모델을 능가한다.

    Xiao Yu, Baolin Peng, Ruize Xu, Hao Zou, Qianhui Wu

  2. #27Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers

    WorldWeaver는 다중 에이전트 환경에서 일관된 세계 상태를 유지하는 스트리밍 비디오 확산 모델로, 세계 상태 레지스터와 Mixture-of-Transformers(MoT) 구조를 도입한다.

    Sicheng Mo, Yuheng Li, Ziyang Leng, Krishna Kumar Singh, Bolei Zhou

  3. #28Sample-Efficient Learning from Agent Experience

    경험 기반 학습에서 샘플 효율성을 향상시키기 위한 Experience Distillation 방법을 제안한다.

    Chenhui Gou, Haoqin Tu, Yunhao Fang, Jianfei Cai, Hamid Rezatofighi

  4. #29AutoIndex: Learning Representation Programs for Retrieval

    AutoIndex는 BM25 기반 검색 성능을 향상시키기 위해 문서 표현 프로그램을 학습하는 프레임워크로, CRUMB 벤치마크에서 평균 +8.4%의 Recall@100 개선을 달성했다.

    Sam O'Nuallain, Nithya Rajkumar, Ramya Narayanasamy, Hanna Jiang, Shreyas Chaudhari

  5. #30Robostral Navigate

    Robostral Navigate는 단일 RGB 카메라만 사용해 R2R-CE에서 77.4% 성공률을 달성한 8B 규모의 시각-언어 네비게이션 모델이다.

    Arjun Majumdar, Avinash Sooriyarachchi, Benjamin Tibi, Chris Bamford, Elliot Chane-Sane

  6. #31Predictive Divergence Masks for LLM RL

    PPO 기반 방향 기준의 한계를 보완한 predictive divergence mask를 제안하여 LLM RL의 훈련 안정성과 효과성을 개선한다.

    Xiangxin Zhou, Jiarui Yao, Penghui Qi, Bowen Ping, Jiaqi Tang

  7. #32FVAttn: Adaptive Sparse Attention with Runtime Load Balancing for Video Generation

    FVAttn은 다중 GPU 환경에서 실행 효율성을 향상시키는 적응형 희소 어텐션 시스템으로, 런타임 로드 밸런싱과 슬랙 인식 희소 증강을 통해 어텐션 속도를 4.41배 개선한다.

    Hao Liu, Chenghuan Huang, Ye Huang, Zhiying Wen, Hao Liu

  8. #33ATSplat: Compact Feed-forward 3D Gaussian Splatting with Adaptive Token Expansion

    ATSplat은 적응형 토큰 확장을 통해 3D Gaussian Splatting의 장점을 복원한 실시간 렌더링 성능을 갖는 컴팩트한 피드포워드 프레임워크이다.

    Cho In, Jeonghwan Cho, Mijin Yoo, Gim Hee Lee, Seon Joo Kim

  9. #34Where Should Optimizer State Live? Tiered State Allocation for Memory-Efficient Mixture-of-Experts Training

    SkewAdam은 MoE 모델의 파라미터 집단별 특성에 따라 최적화 상태를 분류하여 메모리 효율성을 97.4% 개선하고 성능 저하 없이 학습을 수행한다.

    Nuemaan Malik

  10. #35ICAE-Bench: Evaluating Coding Agents as Interactive Project Builders

    ICAE-Bench는 퍼지 요구사항 기반 프로젝트 생성 능력을 평가하는 새로운 벤치마크이다.

    Zhongyuan Peng, Dan Huang, Chuyu Zhang, Caijun Xu, Changyi Xiao

  11. #36Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning

    Trace는 다영역 시각 추론을 위한 세분화된 프로그램 중심 환경으로, 24개 외부 벤치마크에서 Qwen2.5-VL-3B와 7B 모델의 성능을 각각 3.51%와 4.06% 개선한다.

    Md Tanvirul Alam

  12. #37Reading and Steering Representations of Materials-Science Mechanisms in an Open-Weight Language Model

    Gemma-4-E4B-it 모델에서 물리적 메커니즘 정보가 세 가지 형태로 분리 가능하며, Jacobian lens와 직접 읽기 기법을 통해 내부 표현을 분석하고 제어할 수 있음.

    Markus J. Buehler

  13. #38Transcription Policy as a Latent Variable: Activating Controllable Verbatim ASR with Word-Level Timing

    ASR 모델에서 전사 스타일을 명시적 변수로 제어하여 해독 불안정성과 평가 혼란을 해결하고, 정확한 단어 수준 타이밍을 달성한다.

    Laurin Wagner, Mario Zusag, Bernhard Thallinger

  14. #39Delineate Anything v2: A Global Foundation Model for Field Delineation

    Delineate Anything v2는 7300만 개의 다중 해상도 데이터셋 FBIS-73M을 기반으로 전 세계 61개국의 농지 경계를 정확히 추출하는 글로벌 펀다멘탈 모델이다.

    Mykola Lavreniuk, Nataliia Kussul, Andrii Shelestov, Yevhenii Salii, Volodymyr Kuzin

  15. #40Train the Model, Not the Reader: Decodability Supervision for Verifiable Activation Explanations

    RECAP은 활성화 설명의 신뢰성을 향상시키기 위해 타겟 모델 자체를 학습하는 새로운 접근법을 제시한다.

    Hiskias Dingeto

  16. #42G-MAD: A Game-Based Data Generation Framework for Multi-View RGB-T Aerial Object Detection

    G-MAD는 Arma3 기반의 다중 뷰 RGB-T 항공 객체 탐지 합성 데이터 생성 프레임워크로, AMOD 벤치마크를 구축하여 실세계 이전 학습을 지원한다.

    Yechan Kim, JongHyun Park, Dongho Yoon, Namhoon Jung, Moongu Jeon

  17. #43GraphVid: Interactive Graph-Controllable Video Generation

    GraphVid는 구조화된 상호작용 그래프를 기반으로 정밀한 멀티오브젝트 제어를 가능하게 하는 이미지-비디오 생성 모델이다.

    Vedant Shah, Onkar Susladkar, Tushar Prakash, Kiet Nguyen, Tianjio Yu

  18. #44Differentiable Logic Gate Networks for Low-Latency EEG Classification on Edge Devices

    Diff-Logic은 부동소수점 연산 대신 비트 연산을 기반으로 한 EEG 분류 성능과 지연 시간을 동시에 개선하는 신경망 구조를 제안한다.

    Shyamal Y. Dharia, Stephen D. Smith, Camilo E. Valderrama

  19. #45SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments

    SeededGrasp는 언어 지시에 기반한 복잡한 환경에서 다중 로봇 형태의 정밀한 그립 생성을 위한 데이터 효율적인 프레임워크이다.

    Yang Xu, Gurpreet Singh Mukker, Raymond Wang, Jasper Gerigk, Maria Attarian

  20. #46ENTRAP-VL: A Taxonomic Probe for Dual Contextual Entrainment in Vision-Language Models

    ENTRAP-VL은 시각-언어 모델에서 문맥에 의한 출력 편향을 체계적으로 평가하기 위한 이중 모달성 탐사 도구이다.

    Karan Goyal, Afreen Hossain, Debojyoti Das, Vishal Bhutani

  21. #47SLAM in Low-Light Environments: Project Report

    저조도 환경에서 RGB 카메라 기반 SLAM의 한계와 성능을 LaMARia 데이터셋을 통해 6개 시스템으로 평가한 연구.

    Oleh Basystyi, Anna Stasyshyn, Oleksandr Kosovan, Yaroslav Prytula

  22. #48Computational Humor with Multimodal LLMs: Methods, Datasets, Evaluation, and Challenges

    다중모달 풍자 이해는 AI가 비직관적 의미와 문화적 맥락을 해석하는 능력을 요구하며, 이를 위한 모델 평가와 데이터셋 설계가 주요 과제이다.

    Tuo Liang, Zhe Hu, Disheng Liu, Jing Li, Yu Yin

  23. #49Dataset Distillation by Influence Matching

    Inf-Match는 최종 모델 파라미터에 미치는 영향을 일치시키는 방식으로 데이터셋 디스틸레이션을 수행하여 기존 방법 대비 정확도를 향상시킨다.

    Haoru Tan, Wang Wang, Sitong Wu, Xiuzhe Wu, Yangtian Sun

  24. #50Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation

    Moving Alphabet이라는 제어된 실험 환경을 통해 텍스트-비디오 생성 모델의 훈련 데이터 분포와 캡션 품질의 영향을 정량적으로 분석했다.

    Amber Yijia Zheng, Lu Liu, Raymond A. Yeh, Xi Yin

인기 키워드

reinforcement-learning (261) llm (147) diffusion-models (136) llm-agents (116) vlm (101) video-generation (91) transformer (86) llm-evaluation (83) long-context (69) vision-language (69) code-generation (62) benchmark-evaluation (61) long-horizon (59) retrieval-augmented (55) foundation-models (52) text-to-image (52) benchmarking (50) flow-matching (50) large-language-models (50) language-models (48)