HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-09-17 featured 논문 30편

  1. #1ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search

    ZGCM-1은 73억 파라미터의 오픈소스 기반 모델로, 256K 컨텍스트에서 수학적 추론과 에이전트 검색 성능을 극대화한 효율적인 학습 레시피를 제시한다.

    Jiyan He, Guang Liang, Hao Liu, Haoxiang Guan, Jinbo Sun

  2. #2CODI: Compressing Chain-of-Thought into Continuous Space via Self-Distillation

    CODI는 자연어 사고 과정을 연속 공간으로 압축해 GPT-2 규모에서 3.1배 압축률과 28.2% 정확도 향상을 달성한 새로운 사고 방식 학습 프레임워크이다.

    Zhenyi Shen, Hanqi Yan, Linhai Zhang, Zhanghao Hu, Yali Du

  3. #3Direct3D: Scalable Image-to-3D Generation via 3D Latent Diffusion Transformer

    Direct3D는 이미지-3D 생성에서 다뷰 확산 모델이나 SDS 최적화 없이, 3D 잠재 공간 기반의 생성 모델을 통해 새로운 기준점을 제시한다.

    Shuang Wu, Youtian Lin, Feihu Zhang, Yifei Zeng, Jingxi Xu

  4. #4CharXiv: Charting Gaps in Realistic Chart Understanding in Multimodal LLMs

    CharXiv는 실제 과학 논문에서 추출한 2,323개의 다양한 차트를 기반으로 MLLM의 차트 이해 능력을 평가하는 새로운 벤치마크로, GPT-4o와 InternVL Chat V1.5 간 17.9%의 성능 격차를 드러낸다.

    Zirui Wang, Mengzhou Xia, Luxi He, Howard Chen, Yitao Liu

  5. #5Applying Guidance in a Limited Interval Improves Sample and Distribution Quality in Diffusion Models

    이 연구는 확산 모델에서 가이던스를 제한된 노이즈 구간에만 적용함으로써 샘플 품질과 추론 속도를 동시에 향상시킨다.

    T. Kynkäänniemi, M. Aittala, T. Karras, S. Laine, Timo Aila

  6. #6LLMs Know More Than They Show: On the Intrinsic Representation of LLM Hallucinations

    LLMs는 내부 표현에 사실성 정보를 다량 포함하고 있으나, 이 정보는 특정 토큰에 집중되어 있으며, 태스크별로 일반화되지 않는다.

    Hadas Orgad, Michael Toker, Zorik Gekhman, Roi Reichart, Idan Szpektor

  7. #7LLM-Assisted Static Analysis for Detecting Security Vulnerabilities

    IRIS는 GPT-4와 정적 분석을 결합한 신경-기호적 접근법으로, Java 프로젝트에서 보안 취약점을 55개 탐지하며 기존 도구 대비 103.7% 개선.

    Ziyang Li, Saikat Dutta, Mayur Naik

  8. #8KernelBench: Can LLMs Write Efficient GPU Kernels?

    KernelBench는 LLM이 효율적인 GPU 커널을 생성할 수 있는지 평가하는 오픈소스 프레임워크로, 250개 PyTorch 워크로드에서 기능적 정확성과 속도 향상을 측정한다.

    Anne Ouyang, Simon Guo, Simran Arora, Alex L. Zhang, William Hu

  9. #9Foundation Models for Time Series Analysis: A Tutorial and Survey

    시계열 분석을 위한 Foundation Models(FMs)의 최신 연구와 방법론적 분류를 체계적으로 정리한 서베이 논문.

    Yuxuan Liang, Haomin Wen, Yuqi Nie, Yushan Jiang, Ming Jin

  10. #10Mitigating Hallucinations in Large Vision-Language Models with Instruction Contrastive Decoding

    ICD는 LVLM의 환각을 줄이기 위해 표준 및 교란 지시문의 분포를 대비하는 새로운 추론 방법이다.

    Xintong Wang, Jingheng Pan, Liang Ding, Christian Biemann

  11. #11NVILA: Efficient Frontier Visual Language Models

    NVILA는 "scale-then-compress" 전략을 통해 정확도와 효율성을 동시에 최적화한 오픈 소스 비주얼 언어 모델이다.

    Zhijian Liu, Ligeng Zhu, Baifeng Shi, Zhuoyang Zhang, Yuming Lou

  12. #285Atria Dawn: The Dawn of Agentic Superintelligence

    Atria Dawn Preview는 744억 파라미터 MoE 기반의 연구 및 엔지니어링용 에이전트 언어 모델로, 인간-에이전트 협업을 통해 16개 벤치마크에서 경쟁력을 보였다.

    Honglin Guo, Tao Gui, Yicheng Chen, Guanting Dong, Qiming Ge

  13. #286Agent as Policy for Robotic Manipulation

    Agent as Policy (AGP)는 일반적인 에이전트를 로봇 정책으로 활용하여, 실물 조작에서 100% 성공률을 달성하는 시스템이다.

    Mengzhao Jia, Yang Lin, Xixin Zhang, Zhihan Zhang, Xiaobai Liu

  14. #297Planning or Learning: Reliability and Cost in Multi-Asset Maintenance

    다중 자산 유지보수에서 계획(planning)과 강화학습(RL)의 신뢰성과 비용 효율성 비교를 통해 보완적인 접근법임을 밝힘.

    Xian Yeow Lee, Chandrasekar Venkatraman, Ahmed Farahat

  15. #302Continual Learning Mechanisms Compose for Long-Horizon Memorization

    100개의 순차적 작업 학습에서 34.9%의 최종 기억률을 달성한 복합 메커니즘 조합 연구.

    Zheyuan Zhang, Alvin Zhang, Daniel Khashabi, Tianmin Shu

  16. #306PhysBrain 1.5: From Vision-Language Models to Physical Foundation Models

    PhysBrain 1.5는 8B 규모로 28개의 체화된 평가에서 평균 72.5 점을 달성한 오픈소스 물리 기초 모델이다.

    DeepCybo Team, Yu Bin, Haipeng Cao, Zheng Chang, Kai Chen

  17. #307Root-Cause Attribution Is a Search Problem: Continual Search for Long-Horizon Agent Failures

    긴 시간 범위의 에이전트 실패 원인을 추적하는 문제를 반복적 탐색 프레임워크로 해결하여 GPT-5.5의 F1 점수를 0.349에서 0.498로 40% 이상 향상시킨다.

    Harsh Raj, David Lee, Anas Mahmoud, Renxiong Wang, Razvan-Gabriel Dumitru

  18. #308AlayaVista: Streaming World Modeling from Panoramic States to Perspective Video

    AlayaVista는 패러메트릭 카메라 제어를 통해 패러스펙티브 영상 생성과 팬오라마 세계 모델링을 분리한 실시간 스트리밍 비디오 월드 모델이다.

    Jiaming Tan, Mingliang Zhai, Zhen Li, Yuwei Wu, Chuanhao Li

  19. #309AI for Games in the Foundation Model Era

    게임 AI 분야에서 기초 모델이 다양한 역할을 수행하며, 그간 분리되어 발전한 연구 주제들이 통합되고 있다.

    Meng Luo, Yanlin Li, Hao Li, Hongzhan Lin, Pengfei Zhou

  20. #310E2A-Bench: Benchmarking Evidence-to-Action Reliability in Financial Chart Reasoning

    E2A-Bench는 금융 차트 추론에서 증거-행동 신뢰도를 평가하는 969개 질문을 포함한 벤치마크로, 기존 홀루시네이션 점수의 한계를 드러낸다.

    Xiaoya Wang, Yutong Xu, Junjie Wang

  21. #311StepAudio 3 Realtime Technical Report

    StepAudio 3 Realtime은 Think-While-Speaking을 통해 실시간 대화 중 사고와 응답을 병행하는 오디오-언어 기반 모델로, MMSU 90.6, τ-Voice 56.0% 등 주요 지표에서 뛰어난 성능을 보인다.

    Bin Lin, Bo Zhao, Boyang Zhang, Boyong Wu, Chao Yan

  22. #312The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement

    AI가 경험을 기반으로 스스로 개선하는 RSI 개념을 제시하고, 구현 단계와 주요 도전점을 분석한다.

    Yi Duan, Ying Liu, Zirui Tang, Haodong Chen, Jun Zhou

  23. #313StepAudio 3 Music Technical Report

    StepAudio 3 Music은 ABC-CoT 기반의 음악 계획과 텍스트 제어를 지원하는 대규모 장시간 음악 생성 모델이다.

    Chengli Feng, Zhiyue Wu, Jiahao Song, Zheqi Dai, Boyang Wang

  24. #314RSIAgent: Autonomous Exploration for Recursive Self-improvement in New Environments

    RSIAgent는 새로운 환경에서 모델 파라미터 업데이트 없이 자율적으로 메모리를 구축하고 재사용하는 다중 에이전트 프레임워크이다.

    Sibo Zhu, Shicheng Fan, Xinyue Wang, Wenyi Wu, Kun Zhou

  25. #315Grouped Value Attention: Efficient KV Caching via On-Demand Key Reconstruction

    GVA는 KV 캐시 공간을 45-47% 절감하면서 GQA 수준의 성능을 유지하는 새로운 어텐션 메커니즘이다.

    Vishesh Tripathi, Abhay Kumar, Ramsha Khan

  26. #316LLMs as Master Forgers: Generating Synthetic Time Series Data for Manufacturing

    LLM을 활용한 제조 공정 시계열 데이터 생성 프레임워크를 제안한다.

    Mantek Singh, Jeshwanth Challagundla, Prateek Karnal, Gagan Ganapathy, Vineet Shah

  27. #317LynnReal-Omni: Native multi-modal Video Generation for Agentic Visual Workflows

    LynnReal-Omni는 32B 다중 모달 디퓨전 트랜스포머를 기반으로, 텍스트-비디오 생성부터 게임 기록까지 다양한 입력을 통합 처리하는 통합형 비디오 생성 프레임워크이다.

    Xiaofeng Mao, Peijia Lin, Shaohao Rui, Yibo Zhang, Haibin Wan

  28. #318Dynin-Robotics: Omnimodal Unified Diffusion Vision-Language-Action Model

    Dynin-Robotics는 언어-비주얼-액션을 통합한 공유된 마스킹 확산 모델로, 78.4%의 성공률을 달성하고 29.2× 가속화된 액션 디코딩을 지원한다.

    Hoeun Lee, Jaeik Kim, Jusang Oh, Jinhyeok Kim, Geon Choi

  29. #319How Lossless Is Lossless Speculative Decoding? The Role of Numerical Precision in Orthrus

    Orthrus는 BF16 정밀도에서 43~45%의 정확한 추론 경로 일치율을 보이며, 수치 정밀도가 "무손실 추론"의 실현에 결정적임을 밝힌다.

    Ilya Koziev, Leonid Sinev, Ivan Oseledets

  30. #320Disentangling Representation Evolution in Transformers through Directional Decomposition

    Transformer의 표현 진화를 방향 분해를 통해 분석하고, 편집, 압축, 학습 과정에서의 영향을 실증적으로 규명한다.

    Shwai He, Haichao Zhang, Shen Yan

인기 키워드

reinforcement-learning (356) diffusion-models (207) llm (205) llm-agents (167) llm-evaluation (141) video-generation (140) transformer (135) vision-language (129) vlm (110) long-context (108) large-language-models (104) code-generation (98) long-horizon (92) benchmark-evaluation (91) benchmarking (87) language-models (82) retrieval-augmented (79) foundation-models (76) world-models (73) flow-matching (72)