HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-09-16 featured 논문 30편

  1. #1ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search

    ZGCM-1은 73억 파라미터의 오픈소스 기반 모델로, 256K 컨텍스트에서 수학적 추론과 에이전트 검색 성능을 극대화한 효율적인 학습 레시피를 제시한다.

    Jiyan He, Guang Liang, Hao Liu, Haoxiang Guan, Jinbo Sun

  2. #2Expandable Subspace Ensemble for Pre-Trained Model-Based Class-Incremental Learning

    EASE는 사전 학습 모델 기반의 클래스 증분 학습에서 과거 지식을 유지하면서 새로운 클래스를 학습하는 확장 가능한 서브스페이스 앙상블 방법을 제안한다.

    Da-Wei Zhou, Hai-Long Sun, Han-Jia Ye, De-chuan Zhan

  3. #3A Comprehensive Survey of Hallucination in Large Language, Image, Video and Audio Foundation Models

    대규모 기초 모델(FMs)에서 발생하는 환각(hallucination) 문제를 다중 모달에서 체계적으로 분류하고 해결 방안을 제시한 종합적 서베이 논문.

    Pranab Sahoo, Prabhash Meharia, Akash Ghosh, Sriparna Saha, Vinija Jain

  4. #4A derivative-fidelity failure mode in physics-informed neural networks: strengthened benchmark evidence from function-value training

    PINNs에서 함수값 정확도가 미분 정확도를 보장하지 않는 실패 모드를 제시한다.

    Koji Koyamada

  5. #5MLVU: Benchmarking Multi-task Long Video Understanding

    MLVU는 장시간 동영상 이해 능력을 종합적으로 평가하기 위한 다중 작업 벤치마크로, 기존 한계를 극복하고 MLLM의 성능을 체계적으로 분석한다.

    Junjie Zhou, Yan Shu, Bo Zhao, Boya Wu, Shitao Xiao

  6. #6Efficient LoFTR: Semi-Dense Local Feature Matching with Sparse-Like Speed

    Efficient LoFTR는 LoFTR의 효율성 문제를 해결하며, 2.5배 빠른 속도로 준밀도 매칭 성능을 향상시킨다.

    Yifan Wang, Xingyi He He, Sida Peng, Dongli Tan, Xiaowei Zhou

  7. #7WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild

    WildBench는 실제 사용자 채팅 로그에서 추출한 1,024개의 과제를 기반으로 LLM을 평가하는 자동 평가 프레임워크로, WB-Reward와 WB-Score라는 두 메트릭을 통해 높은 신뢰도의 자동 평가를 제공한다.

    Bill Yuchen Lin, Yuntian Deng, K. Chandu, Faeze Brahman, Abhilasha Ravichander

  8. #8Pelican-Sim 1.0: A General World Model Simulator for Embodied Intelligence

    Shilong Zou, Shilin Zhang, Yingji Zhang, Yuhang Huang, Yi Zhang

  9. #9VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time

    VASA-1은 단일 정적 얼굴 이미지와 음성 입력으로 실시간으로 생생한 말하는 얼굴 영상을 생성하는 모델로, 높은 품질과 40 FPS의 처리 속도를 제공한다.

    Sicheng Xu, Guojun Chen, Yu-Xiao Guo, Jiaolong Yang, Chong Li

  10. #10Arcee’s MergeKit: A Toolkit for Merging Large Language Models

    MergeKit은 대규모 언어 모델의 체크포인트를 병합하여 다중 작업 성능을 향상시키는 오픈소스 툴킷이다.

    Charles Goddard, Shamane Siriwardhana, Malikeh Ehghaghi, Luke Meyers, Vladimir Karpukhin

  11. #11MDAgents: An Adaptive Collaboration of LLMs for Medical Decision-Making

    MDAgents는 복잡한 의료 결정 과제에서 LLM들의 협업 구조를 자동화하여 7/10 벤치마크에서 최고 성능을 달성한 의료 AI 프레임워크이다.

    Y. Kim, Chanwoo Park, H. Jeong, Yik Siu Chan, X. Xu

  12. #12VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents

    VisRAG는 VLM을 기반으로 문서를 직접 이미지로 임베딩하여 RAG 파이프라인의 정보 손실을 줄이고, 20~40%의 종단간 성능 향상을 달성한 다중 모달 문서 처리 기법이다.

    Shi Yu, Chaoyue Tang, Bokai Xu, Junbo Cui, J. Ran

  13. #13Multi-Modal Hallucination Control by Visual Information Grounding

    M3ID는 VLM의 환상 생성을 감소시키는 무학습 추론 시 간섭 방법으로, 시각적 정보와의 상호정보를 최대화하여 언어 사전에 대한 과도한 의존성을 줄인다.

    Alessandro Favero, L. Zancato, M. Trager, Siddharth Choudhary, Pramuditha Perera

  14. #286Vidu S2: Real-Time Interactive, Editable, and Spatial Video Generation

    Vidu S2는 실시간 인터랙티브 아바타 생성과 편집 기능을 갖춘 실시간 영상 생성 모델로, 720p 해상도와 다이내믹 레퍼런스, 강화된 인스트럭션 팔로잉을 지원한다.

    Jintao Zhang, Kai Jiang, Jintao Chen, Xu Wang, Deyuan Liu

  15. #289Agent as Policy for Robotic Manipulation

    Agent as Policy (AGP)는 일반적인 에이전트를 로봇 정책으로 활용하여, 실물 조작에서 100% 성공률을 달성하는 시스템이다.

    Mengzhao Jia, Yang Lin, Xixin Zhang, Zhihan Zhang, Xiaobai Liu

  16. #291Atria Dawn: The Dawn of Agentic Superintelligence

    Atria Dawn Preview는 744억 파라미터 MoE 기반의 연구 및 엔지니어링용 에이전트 언어 모델로, 인간-에이전트 협업을 통해 16개 벤치마크에서 경쟁력을 보였다.

    Honglin Guo, Tao Gui, Yicheng Chen, Guanting Dong, Qiming Ge

  17. #301Planning or Learning: Reliability and Cost in Multi-Asset Maintenance

    다중 자산 유지보수에서 계획(planning)과 강화학습(RL)의 신뢰성과 비용 효율성 비교를 통해 보완적인 접근법임을 밝힘.

    Xian Yeow Lee, Chandrasekar Venkatraman, Ahmed Farahat

  18. #308Dream-RSI: Recursive Self-Improvement through Evolving Worlds

    Dream-RSI는 과거 탐색 기록을 재생 시뮬레이터로 활용해 메타-탐색 정책을 저비용으로 개선하는 반복적 자기 개선 프레임워크이다.

    Tong Zheng, Xidong Wu, Zheng Zhang, Zhankui He, Chaoyi Zhang

  19. #309Occamy-1.0: Open Pareto-frontier 35B Intelligence for Co-work

    Occamy-1.0은 Qwen3.6-35B-A3B 기반으로 훈련된 35B 파라미터 규모의 효율적 공동작업 에이전트 모델이다.

    Wenhui Chen, Shiwen Cheng, Hao Dong, Chenda Duan, Ruixiang Feng

  20. #310PhysBrain 1.5: From Vision-Language Models to Physical Foundation Models

    PhysBrain 1.5는 8B 규모로 28개의 체화된 평가에서 평균 72.5 점을 달성한 오픈소스 물리 기초 모델이다.

    DeepCybo Team, Yu Bin, Haipeng Cao, Zheng Chang, Kai Chen

  21. #311AlayaVista: Streaming World Modeling from Panoramic States to Perspective Video

    AlayaVista는 패러메트릭 카메라 제어를 통해 패러스펙티브 영상 생성과 팬오라마 세계 모델링을 분리한 실시간 스트리밍 비디오 월드 모델이다.

    Jiaming Tan, Mingliang Zhai, Zhen Li, Yuwei Wu, Chuanhao Li

  22. #312DataFlex-RL: An Evaluation Platform for RLVR Data Policies

    DataFlex-RL은 RLVR 데이터 정책을 비교하는 평가 플랫폼으로, 다양한 설정에서 균일 샘플링 대비 일관된 성능 향상이 없음을 밝힘.

  23. #313E2A-Bench: Benchmarking Evidence-to-Action Reliability in Financial Chart Reasoning

    E2A-Bench는 금융 차트 추론에서 증거-행동 신뢰도를 평가하는 969개 질문을 포함한 벤치마크로, 기존 홀루시네이션 점수의 한계를 드러낸다.

    Xiaoya Wang, Yutong Xu, Junjie Wang

  24. #314MobileVLA-R1 2.0: RL-Enhanced Reasoning for Mobile Robot Control

    MobileVLA-R1 2.0은 강화학습을 결합한 VLA 프레임워크로, 언어-비전-작업 실행 일관성을 향상시킨다.

    Ting Huang, Yue Huang, Zeyu Zhang, Shuicheng Yan, Hao Tang

  25. #315Grouped Value Attention: Efficient KV Caching via On-Demand Key Reconstruction

    GVA는 KV 캐시 공간을 45-47% 절감하면서 GQA 수준의 성능을 유지하는 새로운 어텐션 메커니즘이다.

    Vishesh Tripathi, Abhay Kumar, Ramsha Khan

  26. #316LynnReal-Omni: Native multi-modal Video Generation for Agentic Visual Workflows

    Xiaofeng Mao, Peijia Lin, Shaohao Rui, Yibo Zhang, Haibin Wan

  27. #317ReactHuman: A Physics-Grounded Benchmark for Human-Like Reactive Decision-Making in Embodied Multimodal LLMs

    Yizhan Li, Jianxin You, Mengyang Xiong, Yinhuan Chen, Zicheng Zhao

  28. #318StepAudio 3 Gen Technical Report

    StepAudio 3 Gen은 단일 프레임워크 내에서 다양한 오디오 생성을 지원하는 이산 자가회귀 모델로, RVQ 토크나이저와 RVQ Adaptor를 통해 TTS 및 보이스 디자인에서 최고 성능을 달성한다.

  29. #319Attention-DP3: Spatially Object-aware 3D Diffusion Policy via Geometry-aligned Attentional Conditioning

    Attention-DP3는 3D 포인트 클라우드에서 객체 인식을 강화한 디퓨전 정책으로, MetaWorld에서 73% 성공률을 달성했다.

    Changbo Yan, Zhongbo Zhang, Zaibin Zhang, Yifan Wang, Lijun Wang

  30. #320Dynin-Robotics: Omnimodal Unified Diffusion Vision-Language-Action Model

    Dynin-Robotics는 언어-비주얼-액션을 통합한 공유된 마스킹 확산 모델로, 78.4%의 성공률을 달성하고 29.2× 가속화된 액션 디코딩을 지원한다.

    Hoeun Lee, Jaeik Kim, Jusang Oh, Jinhyeok Kim, Geon Choi

인기 키워드

reinforcement-learning (356) diffusion-models (205) llm (202) llm-agents (167) video-generation (140) llm-evaluation (139) transformer (134) vision-language (128) vlm (109) long-context (108) large-language-models (104) code-generation (98) benchmark-evaluation (91) long-horizon (91) benchmarking (87) language-models (82) retrieval-augmented (78) foundation-models (74) flow-matching (72) world-models (72)