HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-07-28 featured 논문 25편

  1. #1O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning

    O-VAD는 도메인 지식 없이 객체 중심 추적과 추론을 통해 산업 영상 이상 탐지를 수행하는 트레이닝-프리 에이전트 프레임워크이다.

    Mei Yuan, Qi Long, Qifeng Wu, Zhenyang Li, Yizhou Zhao

  2. #2Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning

    Molt는 PyTorch 기반의 가벼운 강화학습 학습 프레임워크로, 연구자와 AI 코드 어시스턴트가 알고리즘 흐름을 직관적으로 추적하고 수정할 수 있도록 설계되었다.

    Jian Hu, Huiying Li, Hao Zhang, Binfeng Xu, Yifan Zhang

  3. #3Scaling Native Multimodal Pre-Training From Scratch

    시작부터 멀티모달 데이터로 학습하는 네이티브 멀티모달 사전 학습의 확장 법칙을 실증적으로 규명하여, 모델 크기와 토큰 수의 최적 배분을 제시한다.

    Haoyuan Wu, Aoqi Wu, Hai Wang, Jiajia Wu, Jinxiang Ou

  4. #7Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills

    Skill Self-Play(Skill-SP)는 LLM의 능력을 코진화하는 프레임워크로, 제안자, 해결자, 동적 기술 컨트롤러를 활용한다.

    Siyuan Huang, Pengyu Cheng, Haotian Liu, Tao Chen, Yihao Liu

  5. #9Spectral Prior for Reducing Exposure Bias in Diffusion Models

    Spectral Alignment (SPA)는 확산 모델의 주파수 의존적 노이즈 오류를 보정해 이미지 생성 품질을 향상시키는 가이던스 기반 방법이다.

    Yuya Kobayashi, Masato Ishii, Yuhta Takida, Takashi Shibuya, Yuki Mitsufuji

  6. #13SCALE: Self-Supervised Constraint-Aware Layout GEneration for Local P&R DRV Fixing at Advanced Nodes

    SCALE은 sub-2nm 노드에서 자동 P&R DRV 수정을 위한 자기감독적 레이아웃 생성과 도메인 적응 VLM 기반의 프레임워크이다.

    Chia-Tung Ho, Haoyu Yang, Guanglei Zhou, Yoshi Nishi, Yaguang Li

  7. #14Closing the Loop: Training-Free Revisit Consistency for Autoregressive Generative Rendering

    3D 엔진에서 제공하는 대응 정보를 활용해 훈련 없이 자동 생성 렌더링의 재방문 일관성을 향상시킨다.

    Wenchao Ma, Changran Liu, Sharon X. Huang, Haomiao Jiang

  8. #18DataPrep-Bench: Benchmarking LLMs as Training Data Preparators

    DataPrep-Bench는 LLM 기반 학습 데이터 준비의 두 핵심 능력(데이터 생성 및 품질 평가)을 통합 평가하는 첫 번째 벤치마크이다.

    Hao Liang, Qifeng Cai, Yibo Lin, Jianzhuo Du, Qifeng Xia

  9. #29Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems

    AI 에이전트의 실패 원인을 메모리 관리 문제에서 컨텍스트 라이프사이클 관리 문제로 재정의하고, 이를 구현한 ACM 프레임워크와 Maximem Synap 시스템을 제시한다.

    Gaurav Dadhich

  10. #32Three-Body Scattering for Generative Modeling

    TBSM은 에너지 거리 기반 삼체 산란을 활용해 ImageNet-256에서 FID 1.63을 달성한 일괄 생성 모델이다.

    Peng Sun, Zhenglin Cheng, Deyuan Liu, Jun Xie, Xinyi Shang

  11. #34Spectral Flow Certificates for Depth-Aware Long-Range Propagation in Graph Neural Networks

    Spectral Flow Certificate(SFC)는 GNN의 깊이와 그래프 구조만으로 훈련 전에 장거리 성능을 90% 이상 예측할 수 있는 단일 스칼라 지표를 제안한다.

    Ranjan Veerabhadraswamy, Ajith Jubilson Emerson

  12. #35Neural Feature Governance: Extending Atom Prevalence

    NAP는 구조적 스파스성과 해석성을 동시에 달성하는 베이지안 신경망 프레임워크로, MNIST에서 8%의 노드만 사용하면서도 93.4%의 예측 구간 커버리지를 보인다.

    Idris Karel Seunda Ekwe, Patrick Tenga Shako, Ernest Parfait Fokoué

  13. #36Diffusion Models in Medical Image Inpainting: Challenges, Solution Taxonomy, and Future Directions

    의료 이미지 인페인팅에서 확산 모델의 활용, 주요 아키텍처, 데이터셋, 평가 방법을 60개 연구를 바탕으로 체계적으로 분석하고, 주요 과제와 미래 방향을 제시한다.

    Arthur Dantas Mangussi, Joana Cristo Santos, Ricardo Cardoso Pereira, Ana Carolina Lorena, Mário A. T. Figueiredo

  14. #37LAMAR: An Open Language-Aware Multilingual Alignment Reranker

    LAMAR은 다국어 문서 재정렬 시 언어 일관성을 고려하는 언어 인식 다국어 크로스 인코더로, 언어 일관성 평가에서 nDCG@1 1위 성과를 달성했다.

    Seongtae Hong, Youngjoon Jang, Jungseob Lee, Seungyoon Lee, Heuiseok Lim

  15. #40ICAE-Bench: Evaluating Coding Agents as Interactive Project Builders

    ICAE-Bench는 퍼지 요구사항 기반 프로젝트 생성 능력을 평가하는 새로운 벤치마크이다.

    Zhongyuan Peng, Dan Huang, Chuyu Zhang, Caijun Xu, Changyi Xiao

  16. #41Multi-Head Latent Control: A Unified Interface for LLM Agent Decision Making

    Multi-Head Latent Control은 기존 LLM을 수정하지 않고도 추론 시점의 제어 결정을 개선하는 경량 레이어를 제안한다.

    Amirhosein Ghasemabadi, Ruichen Chen, Bahador Rashidi, Di Niu

  17. #42Train the Model, Not the Reader: Decodability Supervision for Verifiable Activation Explanations

    RECAP은 활성화 설명의 신뢰성을 향상시키기 위해 타겟 모델 자체를 학습하는 새로운 접근법을 제시한다.

    Hiskias Dingeto

  18. #43Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning

    Trace는 다영역 시각 추론을 위한 세분화된 프로그램 중심 환경으로, 24개 외부 벤치마크에서 Qwen2.5-VL-3B와 7B 모델의 성능을 각각 3.51%와 4.06% 개선한다.

    Md Tanvirul Alam

  19. #44IDEAgent: Agentic Quality-Diversity Search for Research Idea Generation

    IDEAgent는 과학적 아이디어 생성을 Quality-Diversity(QD) 탐색으로 모델링한 다중 에이전트 프레임워크로, 32개 주제에서 Yield 지표 기준 3.89배 성능 향상을 보인다.

    Varun Gumma, Navonil Majumder, Soumitra Sinhahajari, Soujanya Poria

  20. #45SceneActBench: Can Agents Act on the 3D Scenes They See?

    SceneActBench는 3D 환경에서 시각 정보를 바탕으로 대리자가 행동하는 능력을 평가하는 새로운 벤치마크이다.

    Yifei Zhao, Xiangxin Zhou, Wenhao Yang, Jiaqi Tang, Pu Jian

  21. #46GraphVid: Interactive Graph-Controllable Video Generation

    GraphVid는 구조화된 상호작용 그래프를 기반으로 정밀한 멀티오브젝트 제어를 가능하게 하는 이미지-비디오 생성 모델이다.

    Vedant Shah, Onkar Susladkar, Tushar Prakash, Kiet Nguyen, Tianjio Yu

  22. #47Differentiable Logic Gate Networks for Low-Latency EEG Classification on Edge Devices

    Diff-Logic은 부동소수점 연산 대신 비트 연산을 기반으로 한 EEG 분류 성능과 지연 시간을 동시에 개선하는 신경망 구조를 제안한다.

    Shyamal Y. Dharia, Stephen D. Smith, Camilo E. Valderrama

  23. #48VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression

    VisCo는 사전 학습된 VLM을 활용한 시각 토큰 압축 프레임워크로, 훈련 비용 없이 높은 압축률에서도 성능을 유지한다.

    Yupeng Zheng, Kai Zou, Bin Liu, Nenghai Yu

  24. #49Dataset Distillation by Influence Matching

    Inf-Match는 최종 모델 파라미터에 미치는 영향을 일치시키는 방식으로 데이터셋 디스틸레이션을 수행하여 기존 방법 대비 정확도를 향상시킨다.

    Haoru Tan, Wang Wang, Sitong Wu, Xiuzhe Wu, Yangtian Sun

  25. #50ENTRAP-VL: A Taxonomic Probe for Dual Contextual Entrainment in Vision-Language Models

    ENTRAP-VL은 시각-언어 모델에서 문맥에 의한 출력 편향을 체계적으로 평가하기 위한 이중 모달성 탐사 도구이다.

    Karan Goyal, Afreen Hossain, Debojyoti Das, Vishal Bhutani

인기 키워드

reinforcement-learning (262) llm (149) diffusion-models (139) llm-agents (117) vlm (101) video-generation (92) transformer (87) llm-evaluation (83) vision-language (72) long-context (70) code-generation (62) benchmark-evaluation (61) long-horizon (59) retrieval-augmented (55) foundation-models (52) text-to-image (52) benchmarking (51) flow-matching (51) large-language-models (51) language-models (48)