HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-08-19 featured 논문 30편

  1. #1How Far is Video Generation from World Model: A Physical Law Perspective

    비디오 생성 모델이 물리 법칙을 학습하는 능력은 확장만으로는 한계가 있으며, 특정 조건에서 색상>크기>속도>형태 순으로 데이터 속성에 의존하는 경향이 있다.

    Bingyi Kang, Yang Yue, Rui Lu, Zhijie Lin, Yang Zhao

  2. #2Large Discovery Models: Empirically-grounded Model-Based Open-Ended Search

    LDM은 생성 모델과 베이지안 비모수 보상 서로게 모델을 결합한, 개방적 가설 공간에서의 효율적 탐색 엔진이다.

    Zhongwei Yu, Yan Song, Xue Yan, Anjie Liu, Xingyu Lu

  3. #3AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders

    AxBench 벤치마크를 통해 LLM 조정 방법 비교 실험에서 ReFT-r1이 SAE보다 우수한 성능을 보임.

    Zhengxuan Wu, Aryaman Arora, Atticus Geiger, Zheng Wang, Jing Huang

  4. #4EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents

    EmbodiedBench는 시각 기반 에미바디드 에이전트의 종합적 평가를 위한 벤치마크로, 1,128개의 다양한 태스크와 6개의 능력 중심 서브셋을 포함한다.

    Rui Yang, Hanyang Chen, Junyu Zhang, Mark Zhao, Cheng Qian

  5. #5R1-Onevision: Advancing Generalized Multimodal Reasoning Through Cross-Modal Formalization

    R1-Onevision은 시각-언어 정보를 정확히 결합하는 새로운 cross-modal 추론 파이프라인과 데이터셋, 평가 벤치마크를 제시하여 멀티모달 추론 성능을 획기적으로 향상시킨다.

    Yi Yang, Xiaoxuan He, H. Pan, Xiyan Jiang, Yan Deng

  6. #6Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models

    "스파스 피처 서킷"을 통해 언어 모델 내 인터프리터블한 인과 그래프를 자동으로 발견하고 편집하는 방법을 제시한다.

    Samuel Marks, C. Rager, Eric J. Michaud, Yonatan Belinkov, David Bau

  7. #7Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts

    ArmoRM과 MoE를 결합한 해석 가능한 보상 모델이 RewardBench에서 최상의 성능을 보인다.

    Haoxiang Wang, Wei Xiong, Tengyang Xie, Han Zhao, Tong Zhang

  8. #8LVBench: An Extreme Long Video Understanding Benchmark

    LVBench는 4시간 이상 긴 영상 이해 능력을 평가하는 새로운 벤치마크로, 기존 모델의 한계를 드러내며 연구 촉진을 목표로 한다.

    Weihan Wang, Zehai He, Wenyi Hong, Yean Cheng, Xiaohan Zhang

  9. #9Long-CLIP: Unlocking the Long-Text Capability of CLIP

    Long-CLIP은 CLIP의 텍스트 길이 제한을 풀어 248 토큰까지 처리하며, 기존 성능을 유지하거나 개선하는 플러그 앤 플레이 방식의 확장 모델이다.

    Beichen Zhang, Pan Zhang, Xiao-wen Dong, Yuhang Zang, Jiaqi Wang

  10. #10OmniGen: Unified Image Generation

    OmniGen은 단일 모델로 텍스트-이미지 생성, 이미지 편집, 조건 기반 생성 등 다양한 이미지 생성 작업을 처리하는 통합 확산 모델이다.

    Shitao Xiao, Yueze Wang, Junjie Zhou, Huaying Yuan, Xingrun Xing

  11. #11The Platonic Representation Hypothesis

    AI 모델의 표현이 시간과 도메인, 데이터 모달리티를 넘어 점점 더 일치하며 "플라톤적 표현"으로 수렴하고 있다는 가설을 제시한다.

    Minyoung Huh, Brian Cheung, Tongzhou Wang, Phillip Isola

  12. #205HarnessEval-W: Agentifying the Evaluation of Visual Worlds

    HarnessEval-W는 세계 모델 평가를 위한 에이전트 기반 파이프라인으로, 330개 평가 사례에서 인간 선호와 높은 일치도를 보인다.

    Weiliang Chen, Haowen Sun, Jun Gao, Jiawei Chi, Hanyang Wang

  13. #303UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations

    UI-Mate는 환경 기반 학습과 인-컨텍스트 데모 학습을 결합한 오픈-웨이트 GUI 에이전트로, OSWorkerBench에서 41.0%의 엄격한 성공률을 달성했다.

    Zihan Ding, Longxu Dou, Qi Gao, Xiangwu Guo, Shengchao Hu

  14. #304Self-Supervised Visual On-Policy Distillation

    S²VOPD는 강화된 학습 신호를 생성하기 위해 학습자의 입력에 정보를 제거하는 방식으로, 특권 정보 없이도 정교한 시각 인식 성능을 향상시킨다.

    Yijiang Li, Yijun Liang, Yunjie Tian, Bingyang Wang, Ke Zhang

  15. #305VideoGAIA: A Benchmark for General AI Assistants on Agentic Video Understanding

    VideoGAIA는 MLLM의 다단계, 도구 활용형 비디오 이해 능력을 평가하는 새로운 벤치마크로, 기존 90% 정확도에 가까운 단일 질문 대답 평가를 넘어서는 새로운 패러다임을 제시한다.

    Fan Zhang, Guangming Yao, Jinyang Wu, Hao Wu, Zheng Lian

  16. #306Agentic Transaction: Towards ACID-Compliant Agent Systems

    LLM 에이전트 시스템에 ACID 트랜잭션 개념을 도입하여 신뢰성과 일관성을 향상시킨다.

    Zhaoyan Sun, Xiaoxiao Wang, Guoliang Li

  17. #307Early Cycle Charge Trajectory Generative Prediction and Full Life Cycle Health Management of Iron-Chromium Flow Batteries Based on FlowBD-E1

    FlowBD-E1은 철-크롬 흐름전지의 초기 사이클 데이터만으로 전체 충전 전압/전류 궤적을 0.731% 이하의 오차로 예측하는 생성 모델이다.

    Suyang Zhuang, Zekun Jiang, Tianhang Zhou

  18. #308VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?

    VibeWorlding은 사용자 질의로부터 3D 오픈 월드를 생성하는 멀티모달 에이전트를 평가하고 훈련하는 통합 프레임워크로, VWE-Bench와 VibeWorlding-Gym을 통해 3D 월드 생성의 정확성과 한계를 분석한다.

    Yansong Ning, Jingwen Ye, Zhongkai Wu, Yang Sun, Yiqin Zhu

  19. #309Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization

    SA-MRPO는 다중 보상 최적화에서 포화 상태에 따라 보상 가중치를 동적으로 재조정하여 학습 효율을 향상시킨다.

    Yixuan Wang, Yifei Chen, Haichao Zhang, Haozheng Luo, Xander Wu

  20. #310MOSS-VL Technical Report

    MOSS-VL은 실시간 영상-언어 상호작용을 핵심 기능으로 설계된 오픈 소스 모델로, 11.3B 파라미터와 게이티드 크로스-어텐션을 통해 OmniMMI Proactive Alerting에서 66.0 점을 달성했다.

    Pengyu Wang, Chenkun Tan, Shaojun Zhou, Qirui Zhou, Yanxin Chen

  21. #311ClawGym II: Exploring Black-Box RL on Agent Harness

    ClawGym II는 복잡한 블랙박스 헤이브스를 통해 일반 에이전트를 안정적이고 확장 가능한 방식으로 최적화하는 통합 RL 프레임워크를 제시한다.

    Huatong Song, Fei Bai, Ming Yang, Renyuan Li, Jia Deng

  22. #312Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence

    Apodex Discovery는 실제 문제 해결을 위한 AI 평가 프레임워크로, AAV 캡시드 설계에서 기존 최고 성능을 7% 초과 달성.

    Brian Wang, Bin Feng, Xiaoman Pan, Chenyang An, Felix Liu

  23. #313DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data

    Mimir v1은 허가된 데이터만을 사용해 10억 파라미터 HRM 모델로, 영어 및 덴마크어 벤치마크에서 뛰어난 성능을 보인다.

    Peter Schneider-Kamp, Jacob Nielsen, Gianluca Barmina, Kenneth Enevoldsen, Lukas Galke Poech

  24. #314An Empirical Study of Training Pixel-Space Text-to-Image Diffusion Models

    픽셀 공간 확산 모델의 대규모 훈련 전략을 실증적으로 분석하고, 래티언트-픽셀 전이 레시피를 제안하여 3.18~4.75배의 추론 가속을 달성했다.

    Dengyang Jiang, Ruoyi Du, Zhennan Chen, Dongyang Liu, Zanyi Wang

  25. #315Advancing Open and Reproducible Relational Learning: RelArena-α, TabPFN-Rel and RPI

    Prior Labs는 RelArena-α, TabPFN-Rel, RPI를 오픈소스로 발표하며 관계 학습 연구의 재현성과 비교성을 강화한다.

    Adrian Hayler, Klemens Flöge, Alan Arazi, Rishabh Ranjan, Jure Leskovec

  26. #316How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks

    AI 연구 에이전트의 실패 원인을 진단하기 위한 100개 과제와 45개 실패 패턴을 제시하는 AutoResearchEval과 ARFT를 소개한다.

    Yanlin Fei, Nazhou Liu, Xinmiao Yu, Shaolong Chen, Lei Li

  27. #317GenRouter: Unified Workflow Routing for Agentic Image Generation

    GenRouter는 다양한 이미지 생성 워크플로우를 통합하고 효율적으로 라우팅하여 비용과 지연을 95%와 65% 줄이는 첫 번째 통합 프레임워크이다.

    Harold Haodong Chen, Zhiyu Hou, Wen-Jie Shu, Weilin Ruan, Yingjie Xu

  28. #318DumpsterCluster: From Dumpster Diving to Serving LLaMA-70B on $60 GPUs

    128개의 중고 V100 GPU로 구성된 DumpsterCluster를 통해 LLaMA-70B 추론을 $22K에 구현하며, 에너지 및 탄소 조건에 따라 경제적·환경적 이점을 분석.

    Zeyu Cao, Xuan Guo, Cheng Zhang, Cheuk Hang Lau, Ilia Shumailov

  29. #319Amplified Does Not Mean Predictive: Reasoning Behaviors in Thinking Models

    15개 모델을 대상으로 15,282개 추론 트레이스를 분석하여, 사고 훈련이 정확도와 강하게 연관된 행동을 증폭시키지 않는다는 사실을 밝힘.

    Jean de Dieu Nyandwi, Leena Mathur, Yonatan Bisk, Robert Hawkins, Graham Neubig

  30. #320Prior Audit-Repair Context Shifts LLM Verifier Thresholds Toward Leniency

    LLM 체커가 이전에 동일한 작업을 수정한 경우, 오류 신고율이 2.8~11.5%포인트 감소한다.

    Parsa Mazaheri, Kasra Mazaheri

인기 키워드

reinforcement-learning (331) diffusion-models (190) llm (190) llm-agents (160) video-generation (129) transformer (126) llm-evaluation (125) vision-language (112) vlm (109) long-context (99) large-language-models (94) code-generation (88) long-horizon (86) benchmark-evaluation (82) benchmarking (80) language-models (75) retrieval-augmented (73) flow-matching (68) world-models (68) foundation-models (67)