HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-09-08 featured 논문 30편

  1. #2Iris: Climbing to the Search Frontier

    Iris-mini와 Iris-pro는 35B-A3B와 397B-A17B 규모로 학습된 검색 에이전트로, SFT-RL climbing을 통해 강력한 성능을 달성했다.

    Ziyuan Liu, Hengqi Liu, Zichuan Wang, Yang Qin, Jiachen Liang

  2. #3Magma: A Foundation Model for Multimodal AI Agents

    Magma는 UI 탐색과 로봇 조작 등 다양한 환경에서 작동하는 멀티모달 에이전트 기반 모델로, SoM과 ToM을 통해 공간-시간적 지능을 획기적으로 향상시킨다.

    Jianwei Yang, Reuben Tan, Qianhui Wu, Ruijie Zheng, Baolin Peng

  3. #4Scaling Proprioceptive-Visual Learning with Heterogeneous Pre-trained Transformers

    HPT는 이질적인 로봇 데이터를 기반으로 정책을 사전 학습하여 20% 이상의 미见过 태스크 성능 향상을 달성한다.

    Lirui Wang, Xinlei Chen, Jialiang Zhao, Kaiming He

  4. #6SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution

    SWE-RL은 소프트웨어 진화 데이터와 규칙 기반 보상으로 LLM의 추론 능력을 향상시키는 새로운 강화 학습 접근법이다.

    Yuxiang Wei, Olivier Duchenne, Jade Copet, Quentin Carbonneaux, Lingming Zhang

  5. #7R-Judge: Benchmarking Safety Risk Awareness for LLM Agents

    R-Judge는 LLM 에이전트의 안전성 판단 능력을 평가하는 벤치마크로, GPT-4o가 74.45%의 F1 점수를 기록했으며, 미세조정이 성능 향상에 효과적임을 밝힘.

    Tongxin Yuan, Zhiwei He, Lingzhong Dong, Yiming Wang, Ruijie Zhao

  6. #8AIR-Bench: Benchmarking Large Audio-Language Models via Generative Comprehension

    AIR-Bench는 대규모 오디오-언어 모델의 생성적 이해 능력을 평가하는 첫 번째 벤치마크로, 19개의 기초 태스크와 2,000개의 개방형 질문을 포함한다.

    Qian Yang, Jin Xu, Wenrui Liu, Yunfei Chu, Ziyue Jiang

  7. #9Global Structure-from-Motion Revisited

    GLOMAP은 전역 Structure-from-Motion 문제를 해결하는 새로운 시스템으로, COLMAP과 유사한 정확도를 유지하면서 수십 배 빠른 처리 속도를 제공한다.

    Linfei Pan, Dániel Baráth, M. Pollefeys, Johannes L. Schönberger

  8. #10Chain of Agents: Large Language Models Collaborating on Long-Context Tasks

    Chain-of-Agents(CoA)는 여러 대형 언어 모델이 협력하여 긴 문맥 작업을 처리하는 새로운 프레임워크로, 최대 10%의 성능 향상을 보인다.

    Yusen Zhang, Ruoxi Sun, Yanfei Chen, Tomas Pfister, Rui Zhang

  9. #11Spider 2.0: Evaluating Language Models on Real-World Enterprise Text-to-SQL Workflows

    Spider 2.0은 632개의 실제 기업 데이터베이스 워크플로우를 기반으로, 기존 텍스트-투-SQL 벤치마크보다 훨씬 복잡한 SQL 생성과 다이얼렉트 이해를 요구하는 새로운 평가 프레임워크이다.

    Fangyu Lei, Fangyu Lei, Jixuan Chen, Yuxiao Ye, Ruisheng Cao

  10. #12ProcessBench: Identifying Process Errors in Mathematical Reasoning

    ProcessBench는 수학적 추론 과정에서 오류를 식별하는 능력을 평가하는 대규모 벤치마크로, 3,400개의 경시대회 수준 문제를 포함한다.

    Chujie Zheng, Zhenru Zhang, Beichen Zhang, Runji Lin, Keming Lu

  11. #13mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding

    DocOwl 1.5는 OCR-free 환경에서 10개의 문서 이해 벤치마크에서 기존 MLLM 대비 최대 10점 이상 성능 향상.

    Anwen Hu, Haiyang Xu, Jiabo Ye, Mingshi Yan, Liang Zhang

  12. #306MaxKernel: Agentic Kernel Generation for TPUs

    MaxKernel은 TPU 커널 최적화를 위한 3가지 에이전트 패러다임을 갖춘 시스템으로, JAXBench에서 1.58× 평균 가속을 달성한다.

    Shangkun Wang, Nina Cai, Charles Hoong, Julian Walker, Gerson Kroiz

  13. #308Bilevel Coordinated Reflection: A Game-Theoretic Approach to Multi-Agent LLM Systems

    다중 에이전트 LLM 시스템에서 SRMA 알고리즘을 도입하여 반영 과정을 게임 이론적 구조로 모델링하고, 72.2%의 SWE-bench 성능 달성.

    Yihang Chen, Yuxiang Chen, Yuxuan Huang, Meng Fang, Weilin Luo

  14. #311UniMate: One Unified Model to Animate Diverse Skeletons

    UniMate는 다양한 스켈레톤에 텍스트 프롬프트만으로 움직임을 생성하는 통합 기반 모델로, 테스트 시 최적화 없이도 Zero-shot 전이를 지원한다.

    Linzhan Mou, Jiahui Lei, Zhiyang Dou, Chenyue Cai, Chaoyue Song

  15. #312Spectral-Target Physical Latent Structuring for JEPA-Style World Models

    JEPA 기반 월드 모델에서 물리적 정보를 효과적으로 인코딩하기 위해 Fourier auxiliary head를 도입하여 planning 성능과 데이터 효율성을 향상시킨다.

    Penghao Zhu, Salvatore Penachio, Kaustav Mukherjee, Aneesh Jonelagadda

  16. #314Motion-Omni: End-to-End Joint Speech and Full-Body Motion for Spoken Dialogue

    Motion-Omni는 대화 중 말과 동작을 동시에 생성하는 엔드투엔드 프레임워크로, 말과 몸짓을 동일한 상태에서 생성하여 실시간 성능과 정확도를 동시에 향상시킨다.

    Chengqian Ma, Wei Tao, Haoyu Zhang, Yiwen Guo

  17. #318When Quantization Breaks Memory: Recurrent-State Write-Back in Low-Precision Temporal Inference

    저정밀 재귀 추론에서 상태 저장 방식인 recurrent-state write-back이 추론 성능에 70~300배의 오차 증가를 유발한다는 것을 실험적으로 밝힘.

    Ismail Erbas, Xavier Intes, Vikas Pandey

  18. #320DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training

    DRACO는 GRPO 내에서 동적 루브릭을 생성하고 이를 기반으로 단계별 보상을 할당하여, AppWorld에서 기존 방법 대비 15.9점 개선된 성능을 달성한 신규 신용 할당 방법이다.

    Shubham Gandhi, Saurabh Goyal, Kiran Kate, Yara Rizk

  19. #322WorldReward: Reward Modeling for Camera-Conditioned World Models

    WorldReward는 카메라 조건에 따른 월드 모델의 행동 일관성과 시각 품질을 통합 평가하는 VLM 기반 이진 선호 보상 모델이다.

    Yibin Wang, Zehan Wang, Junshu Tang, Zhimin Li, Yujie Zhou

  20. #323The Attention Triangle in Audio-Video Models

    음성-비디오 디퓨전 모델에서 주의 메커니즘의 삼각 구조를 분석하고, 이를 기반으로 의미 누수를 진단 및 완화하는 방법을 제시한다.

    Sagi Polaczek, Noa Kraicer, Gal Metzer, Zhuo Ning, Ali Mahdavi-Amiri

  21. #324PACE: Towards Surfacing Hidden Conflicts in User Requests

    PACE 데이터셋과 PaceMaker 다중 에이전트 프레임워크를 제안하여 사용자 요청의 은밀한 충돌을 식별하는 성능을 향상시킨다.

    Yoojin Kim, Jihyoung Jang, Hyounghun Kim

  22. #325WorldSculpt: Generating Compositional Worlds from Grounded Videos

    WorldSculpt는 Pixal3D를 다중 뷰 조건화 경로로 확장하여 밀집된 장면에서도 개별 객체 메시를 생성하는 3D 합성 프레임워크이다.

    Muyao Niu, Jixuan He, Ruihan Yu, Lian Fu, Yonghao Yu

  23. #326Using Grounded Theory for Agent Behavior Analysis at Scale

    AutoTraceGT는 대규모 에이전트 트레이잭토리 분석을 위한 첫 번째 자동화된 Grounded Theory 파이프라인으로, 7,500개 이상의 데이터에서 73-91%의 실패 원인을 복구한다.

    Zhuoran Lu, Yangyang Yu, Zhuoyan Li, Yibo Meng, Nan Jiang

  24. #327FlashRender: Few-Step Generative Rendering via Camera-Controlled Video MeanFlow

    FlashRender는 RETA, MeanFlow, on-policy flow map distillation을 통해 25배 적은 샘플링 비용으로 높은 품질의 카메라 제어 동영상 재렌더링을 실현한 few-step generative rendering 모델이다.

    Byeongjun Park, Byung-Hoon Kim, Hyungjin Chung

  25. #328AdaptVPR: Route-Aware Hard Positive Generation for Robust Visual Place Recognition

    AdaptVPR은 도메인 변화에 강한 VPR 학습을 위해 경로 기반 생성 증강 프레임워크를 제안하며, AdaptCities 데이터셋을 통해 R@1 최대 9.2% 개선을 달성한다.

    Shunpeng Chen, Jingyi Zhang, Changwei Wang, Shengpeng Xu, Yukun Song

  26. #329ShallowStream: Index Shallow then Answer Deep for Streaming Video Understanding

    ShallowStream은 MLLM의 얕은 계층을 활용해 실시간 동영상 처리 비용을 52.1배 감소시키는 새로운 스트리밍 비디오 이해 프레임워크이다.

    Jitai Hao, Ke Yang, Qiang Huang, Jun Yu

  27. #330Enoki: Efficient Multi-Level Hallucination Detection

    Enoki는 OpenIE 기반 다중 수준 hallucination 탐지 프레임워크로, claim-level 검증과 span-level 로컬라이제이션을 공유된 표현으로 통합하여 효율성을 높인다.

    Elisei Rykov, Timur Ionov, Nikolay Ivanov, Maksim Savkin, Maksim Makarenko

  28. #331Ask Before You Optimize: Dynamic Pre-Formulation Clarification for Interactive Optimization

    InterOPT은 OR-Clarify 벤치마크를 통해 미완전한 최적화 문제 설명에서 필요한 정보를 선택적으로 명확히 하며, 모델링 전 준비 여부를 판단하는 시스템이다.

    Sihan Ge, Yichen Lin, Chenyu Zhou, Jianghao Lin, Tao Yao

  29. #332Select, Compress, Reinvest: A Controlled Study of Visual-Token Allocation in Long-Video MLLMs

    1시간 길이 동영상에서 8개의 적절히 선택된 프레임이 16개의 균일하게 선택된 프레임보다 6.9점 높은 성능을 보인다.

    Prakhar Khatri

  30. #333QCell: Recombining and Aligning Cell Queries for Overlapping Instance Segmentation

    QCell은 반투명 세포의 겹침 구분을 위해 인스턴스 재조합 모듈과 대비 학습을 결합한 쿼리 기반 세포 인스턴스 분할 모델이다.

    Yaroslav Prytula, Anton Popov, Dmytro Fishman

인기 키워드

reinforcement-learning (334) diffusion-models (194) llm (193) llm-agents (161) video-generation (133) llm-evaluation (131) transformer (127) vision-language (119) vlm (109) long-context (101) large-language-models (95) code-generation (90) long-horizon (88) benchmark-evaluation (85) benchmarking (82) language-models (76) retrieval-augmented (76) world-models (69) flow-matching (68) foundation-models (67)