HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-08-21 featured 논문 30편

  1. #1SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation

    SemComp-Bench는 생성된 동영상이 지시된 결과를 달성하면서 참조 이미지와 의미적 연관성을 유지하는 능력을 평가하는 새로운 벤치마크 프로토콜이다.

    Keyu Tu, Zhuowei Chen, Mengqi Huang, Yuxin Wang, Jiahao Zhu

  2. #2Reconstruction vs. Generation: Taming Optimization Dilemma in Latent Diffusion Models

    VA-VAE와 LightningDiT를 결합한 시스템이 ImageNet 256 생성에서 FID 1.35 달성하며 21.8× 빠른 수렴 속도를 보인다.

    Jingfeng Yao, Xinggang Wang

  3. #3QuIP#: Even Better LLM Quantization with Hadamard Incoherence and Lattice Codebooks

    QuIP#는 2~4비트에서 최고 성능을 보이는 가중치 전용 양자화 방법으로, 하드웨어 효율적인 E8 격자 코드북과 랜덤 하다마드 변환을 결합한다.

    Albert Tseng, Jerry Chee, Qingyao Sun, V. Kuleshov, Christopher De Sa

  4. #4AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agents

    AndroidWorld는 20개의 실제 Android 앱에서 116개의 프로그래밍 작업을 테스트하는 동적 벤치마크 환경이다.

    Christopher Rawles, Sarah Clinckemaillie, Yifan Chang, J. Waltz, G. Lau

  5. #5InternVideo2: Scaling Foundation Models for Multimodal Video Understanding

    InternVideo2는 6B 파라미터 규모의 멀티모달 영상 이해 모델로, 마스킹된 영상 복원, 크로스모달 대비 학습, 토큰 예측을 통합한 3단계 학습 방식을 채택한다.

    Yi Wang, Kunchang Li, Xinhao Li, Jiashuo Yu, Yinan He

  6. #6Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models

    Prismatic VLMs는 VLM 설계 공간을 체계적으로 탐구하고, 7-13B 규모의 모델이 InstructBLIP과 LLaVa v1.5를 엄격히 초과하는 성능을 보인다.

    Siddharth Karamcheti, Suraj Nair, A. Balakrishna, Percy Liang, Thomas Kollar

  7. #7Hybrid LLM: Cost-Efficient and Quality-Aware Query Routing

    Hybrid LLM은 LLM과 소형 모델의 장점을 결합한 쿼리 라우팅 방식으로, 40%까지 대형 모델 호출을 줄이며 품질 저하 없이 비용 효율성을 확보한다.

    Dujian Ding, Ankur Mallick, Chi Wang, Robert Sim, Subhabrata Mukherjee

  8. #8Group-in-Group Policy Optimization for LLM Agent Training

    GiGPO는 LLM 에이전트의 다단계 학습에서 정밀한 크레딧 할당을 가능하게 하는 새로운 그룹 기반 강화 학습 알고리즘이다.

    Lang Feng, Zhenghai Xue, Tingcong Liu, Bo An

  9. #9SpatialRGPT: Grounded Spatial Reasoning in Vision Language Model

    SpatialRGPT는 3D 공간 인식 능력을 갖춘 VLM을 구현하기 위해 지역 정보와 깊이 정보를 통합한 새로운 모델이다.

    An-Chieh Cheng, Hongxu Yin, Yang Fu, Qiushan Guo, Ruihan Yang

  10. #10LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens

    LongRoPE는 2048k 토큰의 컨텍스트 윈도우를 구현하면서 기존 성능을 유지하는 LLM 확장 기법이다.

    Yiran Ding, L. Zhang, Chengruidong Zhang, Yuanyuan Xu, Ning Shang

  11. #11VideoAgent: Long-form Video Understanding with Large Language Model as Agent

    VideoAgent는 대형 언어 모델을 에이전트로 활용해 장시간 동영상 이해를 효율적으로 수행하는 시스템이다.

    Xiaohan Wang, Yuhui Zhang, Orr Zohar, S. Yeung-Levy

  12. #168SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation

    SemaPLC는 PLC 코드 생성 시 프로젝트 기반 및 검증 기반의 에이전트 허네스를 제시하여 실행 시 정확도를 52.2% 달성한다.

    Yanlun Tu, Huacan Wang, Ziyue Zhou, Jie Zhou, Ningyan Zhu

  13. #294SoftVTBench: A Deformation-Aware Visuo-Tactile Dataset and Benchmark for Deformable-Object Manipulation

    SoftVTBench는 변형 가능 물체 조작의 물리적 상호작용을 평가하는 데 사용되는 시각-촉각 데이터셋 및 벤치마크로, 4,000개의 전문가 시연과 20Hz 동기화 데이터를 포함한다.

    Bowen Jing, Mingxin Wang, Ruiyang Hao, Chenchen Ge, Hanwen Shen

  14. #295Looped Language Models Improve Compositional Tool Calling

    반복형 언어 모델은 복합적인 API 호출 작업에서 성능 향상을 보인다.

    Andrei Cristian Popescu, Haitz Sáez de Ocáriz Borde, Pietro Liò

  15. #306Demystifying Agent Skills: Why They Work-Until They Don't

    LLM 에이전트의 스킬 활용 메커니즘을 체계적으로 분석하여, 언제 작동하고 왜 실패하는지 밝힌 연구.

    Zhiyuan Jiang, Fangrui Huang, Hanwen Xing, Xander Wu, Yipeng Gao

  16. #307Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence

    Zetta는 실시간 실행 중 코드 기반 크리틱과 복구 기술을 진화시키며, 90.8% 성공률을 달성한 클로즈드-루프 에마바디드 허네스이다.

    Xin Ding, Liang Mi, Mingzhe Huang, Zixuan Wang, Chao Zhang

  17. #308ASI-Bench: At the Dawn of Artificial Superintelligence

    ASI-Bench는 AI가 인간 지침 없이 독자적으로 과학 연구를 수행할 수 있는 능력을 평가하는 첫 번째 벤치마크로, 18개 최신 에이전트-모델 설정에서 평균 점수가 50.91에서 26.62로 급락함을 보여준다.

    Junwei Zhou, Zhen Sun, Binyu Li, Jiangyu Zhou, Yuexi Pan

  18. #310Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL

    Co-RL은 다중 에이전트 강화학습을 통해 라벨 없이도 언어 및 비주얼-언어 모델의 추론 성능을 향상시키는 프레임워크이다.

    Yunhao Yang, Yuexin Bian, Yunjie Tian, Di Fu, Tianjin Huang

  19. #311FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution

    FreeToken은 35B부터 753B 파라미터 규모의 MoE 모델을 개인 기기에서 효율적으로 실행하는 엣지 네이티브 서빙 시스템이다.

    Shuo Yang, Xiaoze Fan, Melissa Pan, Haocheng Xi, Zhe Wang

  20. #312Energy-Guided Flow Matching

    Energy-Guided Flow Matching(EG-FM)는 고주파 정보를 점진적으로 복원하는 생성 경로를 도입하여 FID 1.45를 달성한 픽셀 공간 생성 모델이다.

    Haoyang Tong, Yu He, Fang Li, Lichen Ma, Jingling Fu

  21. #313Optimized Fuzzy Logic Approach with the IEEE Key Gas Method for Diagnosing Power Transformer Faults Using Dissolved Gas Analysis

    FL-KGM 모델이 변압기 고장 진단 정확도를 98.6%까지 향상시킨다.

    Kim-Anh Nguyen, Huy Hoang Le, Ba Tu Phung

  22. #314Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation

    TAMP-Nav는 2D VLM 사전 학습과 3D 실행 간의 불일치를 해결하며, 효율적인 탐색을 위한 통합 프레임워크로 R2R-CE에서 66.2%의 SR 성능을 달성한다.

    Hongyan Feng, Sunlai Chen, Xuanyu Liu, Miao Pan, Yangfan Xie

  23. #315SPADE: Self-Play in Adaptive Synthetic Executable Environments

    SPADE는 LLM이 스스로 학습 환경을 생성하며 자기 개선하는 자가 경기 강화 학습 프레임워크로, 30B 파라미터 모델에서 기존 베이스라인 대비 평균 +5.3개선.

    Bo Liu, Simon Yu, Yiding Jiang, Ao Qu, Andrew Zhao

  24. #316From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents

    RUPA는 LLM 에이전트의 실행 트래잭토리에 기반한 관계 기반 불확실성 전파를 통해 신뢰도 높은 UQ를 구현한다.

    Zhengzhao Ma. Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

  25. #317Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis

    C3LM 모델을 Top-K 프롬프팅과 ChemCensor 기반 보상으로 훈련하여 URSA-expert-2026 벤치마크에서 최고 성능을 달성했다.

    Bogdan Zagribelnyy, Ivan Ilin, Nikita Bondarev, Maksim Kuznetsov, Mathieu Reymond

  26. #318V-RAE: Rethinking Video Latent Spaces for Generation

    V-RAE는 동결된 시각 기초 모델의 잠재 공간을 기반으로 동영상 생성을 위한 새로운 잠재 공간 구조를 제안하며, K600에서 2.13 rFVD를 달성한다.

    Minghui Guo, Shengqiong Wu, Hao Fei

  27. #319Agent Lightning v1.0: Towards Harnessed Agentic RL

    Agent Lightning v1.0은 3,500줄의 코드로 구현된, 임의의 agent harness와 호환 가능한 harnessed agentic RL 프레임워크로, SWE-bench Verified에서 Qwen3.5-9B의 성능을 41.8%에서 56.4%로 14.6%p 향상시킨다.

    Zhiyuan He, Siwei Zhang, Zhiwen Zhou, Yuqing Yang, Yu Kang

  28. #320Unifying Graph Neural Networks Through a Common Layer Equation

    그래프 신경망을 일관된 계층 방정식으로 통합하여 200개 이상의 아키텍처를 공통 설계 공간에 정리한다.

    Sai Karthik Navuluru, Siddhartha Shankar Das, Bo Ni, Hongjie Chen, Yu Wang

  29. #321EDITBRIDGE: Towards Faithful and Efficient Ultra-High-Resolution Image Editing

    EditBridge는 초고해상도 이미지 편집에서 정보 분산과 텍스처 저하 문제를 해결하며 4K 편집을 61초 내 수행하는 확률적 다리 기반 프레임워크이다.

    Jiayi Song, Shijie Huang, Fangtai Wu, Yubo Huang, Zhenxiong Tan

  30. #322LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents

    LEGO-RL은 기존 코드 에이전트 허네스를 수정하지 않고 정책 기울기 최적화를 연결하는 프레임워크로, SWE-bench Verified에서 6~9% 성능 향상을 달성했다.

    Yiming Du, Yuxin Jiang, Tao Yuan, Jianbo Dai, Shaowei Wang

인기 키워드

reinforcement-learning (331) diffusion-models (190) llm (190) llm-agents (160) video-generation (129) transformer (126) llm-evaluation (125) vision-language (112) vlm (109) long-context (99) large-language-models (94) code-generation (88) long-horizon (86) benchmark-evaluation (82) benchmarking (80) language-models (75) retrieval-augmented (73) flow-matching (68) world-models (68) foundation-models (67)