HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-09-01 featured 논문 30편

  1. #1TimeMixer++: A General Time Series Pattern Machine for Universal Predictive Analysis

    TimeMixer++는 다중 스케일과 주파수 분해능을 활용해 8가지 시계열 분석 작업에서 최고 성능을 달성한 시계열 패턴 머신이다.

    Shiyu Wang, Jiawei Li, X. Shi, Zhou Ye, Baichuan Mo

  2. #2Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning

    Code-as-World는 실행 가능한 코드로 물리적 세계를 표현하는 새로운 패러다임으로, VLM의 정량적 물리적 추론 성능을 크게 향상시킨다.

    Hanyang Wang, Yimo Cai, Weiliang Chen, Jiawei Chi, Haowen Sun

  3. #3Revisiting Local Context for Long-Horizon Streaming 3D Reconstruction

    ABot-Recon은 11프레임의 로컬 컨텍스트만 사용해 장거리 스트리밍 3D 재구성을 안정적으로 수행하는 모델로, Oxford Spires에서 ATE 4.35m, RPE-R 0.12°를 달성한다.

    Jiarong Han, Jincheng Xiong, Yuzhou Liu, Linzhe Shi, Changjie Wu

  4. #5LongVILA: Scaling Long-Context Visual Language Models for Long Videos

    LongVILA는 2048개의 비디오 프레임을 처리하며 99.8% 정확도를 달성한 장거리 컨텍스트 VLM과 MM-SP 시스템을 결합한 종합 솔루션입니다.

    Fuzhao Xue, Yukang Chen, Dacheng Li, Qinghao Hu, Ligeng Zhu

  5. #6Agent Security Bench (ASB): Formalizing and Benchmarking Attacks and Defenses in LLM-based Agents

    Agent Security Bench(ASB)는 LLM 기반 에이전트의 보안 취약점을 체계적으로 평가하기 위한 벤치마크 프레임워크로, 84.30%의 높은 공격 성공률을 기록하며 방어 기법의 한계를 드러낸다.

    Hanrong Zhang, Jingyuan Huang, K. Mei, Yifei Yao, Zhenting Wang

  6. #7VastGaussian: Vast 3D Gaussians for Large Scene Reconstruction

    VastGaussian은 대규모 장면의 고해상도 재구성과 실시간 렌더링을 위한 3D 가우시안 스플래팅 기반 최초의 방법이다.

    Jiaqi Lin, Zhihao Li, Xiao Tang, Jianzhuang Liu, Shiyong Liu

  7. #8Absolute Zero: Reinforced Self-play Reasoning with Zero Data

    AZR은 외부 데이터 없이 자가 생성 학습을 통해 수학 및 코드 추론에서 최신 성능을 달성한 RLVR 모델이다.

    Andrew Zhao, Yiran Wu, Yang Yue, Tong Wu, Quentin Xu

  8. #9Does Fine-Tuning LLMs on New Knowledge Encourage Hallucinations?

    LLM 미세조정 시 새로운 지식 도입은 학습 속도를 저하시키고, 환각 발생률을 증가시킨다.

    Zorik Gekhman, G. Yona, Roee Aharoni, Matan Eyal, Amir Feder

  9. #10LayerSkip: Enabling Early Exit Inference and Self-Speculative Decoding

    LayerSkip는 LLM 추론 속도를 1.82~2.16× 가속화하는 end-to-end 솔루션으로, early exit과 self-speculative decoding을 결합한 기법이다.

    Mostafa Elhoushi, Akshat Shrivastava, Diana Liskovich, Basil Hosmer, Bram Wasti

  10. #11Unlocking Efficiency in Large Language Model Inference: A Comprehensive Survey of Speculative Decoding

    스펙ulative 디코딩을 통해 대규모 언어 모델의 추론 효율성을 향상시키는 방법을 체계적으로 조사하고 분석한다.

    Heming Xia, Zhe Yang, Qingxiu Dong, Peiyi Wang, Yongqi Li

  11. #12Infinity∞: Scaling Bitwise AutoRegressive Modeling for High-Resolution Image Synthesis

    Infinity는 비트단위 토큰 예측을 기반으로 고해상도 이미지 생성 성능을 획기적으로 향상시킨 오토회귀 모델이다.

    Jian Han, Jinlai Liu, Yi Jiang, Bin Yan, Yuqi Zhang

  12. #13Chain of Thought Empowers Transformers to Solve Inherently Serial Problems

    CoT(Chain of Thought)를 통해 트랜스포머가 직렬 계산 문제를 해결할 수 있는 이론적 근거와 실증적 증거를 제시한다.

    Zhiyuan Li, Hong Liu, Denny Zhou, Tengyu Ma

  13. #296Fast Weight Attention for Continual Learning

    Fast Weight Attention을 활용한 연속 학습 방법론을 제안하고, 언어 모델링 및 수치 연산에서 성능을 검증한다.

    Yifan Zhang, Steve Ta, Jasper Zhang, Jichen Feng, Shuzhen Li

  14. #305Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models

    VLAct는 제한된 로봇 데이터로 전이 가능한 시각-행동 표현을 학습하는 VLA 모델의 지속적 사전 학습 방법이다.

    Senqiao Yang, Chengyao Wang, Yuxin Chen, Zixuan Wang, Longxiang Tang

  15. #309LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering

    LoopArena는 코드 작성 에이전트를 장기 과제에서 효과적으로 제어하는 모델의 능력을 평가하는 벤치마크이다.

    Yi Wang, Haopeng Zhang, Chengxiang Huang, Rui Dai, Kaikui Liu

  16. #312DART-SD: Diamond-topology Aware Retrieval and Tuning for Self-Distillation of Multi-Turn Tool-Calling Agents

    DART-SD는 다중 턴 툴 호출 에이전트의 자기 교사 학습을 위해 다이아몬드 토폴로지를 고려한 새로운 프레임워크로, 정확도와 정책 다양성을 동시에 향상시킨다.

    Hangrui Xu, Jiarui Wang, Yang Yang, Chuanbo Zhu, Fangda Chen

  17. #313Agentic Artifact Creation: Systems, Evaluation, Principles, and Opportunities

    지능형 에이전트가 생성물을 상태를 유지하면서 구축하고 수정하는 과정을 체계적으로 분석한 조사 연구.

    Tianfu Wang, Zhezheng Hao, Xilin Xia, Lixin Liu, Mengkang Hu

  18. #316J-Zero: Unified Challenger--Solver--Judge Co-Evolution from Zero Data

    J-Zero는 제로데이터에서 시작하여 Challenger-Solver-Judge가 공진화하는 프레임워크로, 검증 가능한/불가능한 도메인에서 평균 4.2~8.0점 개선을 달성한다.

    Gyouk Chu, Myeongho Jeon, Eunho Yang

  19. #319Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090

    Puro-2B는 RTX 5090 GPU와 FP8 정밀도를 활용해 6,900달러 미만에 훈련된 2B 파라미터 언어 모델로, Qwen2.5-1.5B 수준의 성능을 달성한다.

    Kairong Luo, Jiarui Cui, Yaorui Yin, Shengqi Chen, Yiming Yang

  20. #320LayerRecall: A State-Conditioned Memory Router for Long-Horizon Consistency in Video Generation

    LayerRecall은 장기 기억을 효과적으로 활용해 동영상 생성의 장기 일관성을 향상시키는 레이어 선택적 메모리 라우터를 제안한다.

    Yixuan Ding, Jiahao Kong, Wei Huang, Ruijie Quan, Yi Yang

  21. #321Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models

    INDI는 VLA 모델의 액션 디코더에 행동 수준의 의도를 증류하여 성능과 일반화 능력을 향상시킨다.

    Sangoh Lee, Sangwoo Mo, Wook-Shin Han

  22. #322ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL

    ContextPilot은 롱-호리즌 에이전트 작업에서 컨텍스트 관리를 강화하기 위해 RL 기반의 세부적인 프레임워크를 제안한 연구이다.

    Zhuoshi Pan, Qizhi Pei, Junru Lu, Honglin Lin, H. Vicky Zhao

  23. #323WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution

    WikiSkill은 지속적인 지식 축적을 통해 에이전트의 스킬 진화를 촉진하는 프레임워크로, 다양한 벤치마크에서 기존 방법을 상회한다.

    Liyan Tang, Cyrus Rashtchian, Chun-Sung Ferng, Andrew Tomkins, Da-Cheng Juan

  24. #325CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes

    CritICL은 약한 모델의 실패 패턴을 활용해 강한 모델의 추론 성능을 향상시키는 추론 시 효율적인 프레임워크이다.

    Yufan Wu, Yinghui He, Zhengyi Hu, Lang Wei, Ruichen Li

  25. #326Locate Anything in Videos: Rethinking Efficient Generative Spatio-Temporal Video Grounding

    Parallel Tube Decoding(PTD)를 제안하여 영상 내 시공간 객체 추적의 효율성과 정확도를 동시에 향상시킨다.

    Hanoona Rasheed, Haania Siddiqui, Ming-Hsuan Yang, Fahad Shahbaz Khan, Salman Khan

  26. #327Blind Men and the Elephant: Probing the Epistemic Myopia of LLMs under Long-Tail Divergent Knowledge

    ElephantBench는 LLM이 극소수의 정보를 기억하는 능력을 평가하기 위한, 다중 정답을 가진 폐쇄형 지식 탐지 벤치마크이다.

    Zhuoshi Pan, Junru Lu, Yan Qian, H. Vicky Zhao, Di Yin

  27. #328Paint What You See: Benchmarking Dexterous Visual Tool Use in Multimodal Agents

    EASEL은 시각적 정밀도가 요구되는 다중 모달 에이전트의 도구 사용 능력을 평가하는 새로운 벤치마크로, 440,000개 샘플의 EASEL-Data와 9B 파라미터 모델 EASEL-9B를 제시한다.

    Shudong Liu, Dongyang Chen, Enci Zhang, Jinwei Liang, Zheng Ma

  28. #329StepGuard: Learning Step-Level Guardrails with Scalable Supervision and Safety-Utility Balancing

    StepGuard는 실행 전 단계에서 도구 행동을 점검하는 스텝 레벨 가드 모델로, AgentDojo와 AgentDyn에서 77.3%의 공격 성공률 감소를 달성했다.

    Zhijie Zheng, Yu Li, Chen Qian, Yuqian Fu, Yanwei Fu

  29. #330Luce: Relightable Gaussians for 3D Asset Generation

    Luce는 이미지에서 재조명 가능한 3D 자산을 생성하기 위한 다중 모달 PBR 가우시안 표현을 제안하며, 기존 기법 대비 28% 개선된 FID 성능을 보인다.

    Mayank Singh, Michele Stoppa, Alvise Memo, Rui Yu, Harsha Kalli

  30. #332Sliding-window beats linear attention

    슬라이딩 윈도우 어텐션(SWA)이 포스트 트레이닝된 라인어 어텐션 모델보다 성능이 우수하며, 추가 학습 없이도 높은 효율성을 보인다.

    Alexia Jolicoeur-Martineau, Rhea Sanjay Sukthanker, Pashmina Cameron, Emy Gervais

인기 키워드

reinforcement-learning (331) diffusion-models (190) llm (190) llm-agents (160) video-generation (129) transformer (126) llm-evaluation (125) vision-language (112) vlm (109) long-context (99) large-language-models (94) code-generation (88) long-horizon (86) benchmark-evaluation (82) benchmarking (80) language-models (75) retrieval-augmented (73) flow-matching (68) world-models (68) foundation-models (67)