HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-09-18 featured 논문 30편

  1. #1RoboTwin: Dual-Arm Robot Benchmark with Generative Digital Twins

    RoboTwin은 3D 생성 모델과 대형 언어 모델을 결합한 디지털 트윈 프레임워크로, 이중 팔 로봇 조작 성능을 70% 이상 향상시킨다.

    Yao Mu, Tianxing Chen, Zanxin Chen, Shijia Peng, Zhiqian Lan

  2. #2In-Context Robot Learning with VLM Agents

    GPT-Policy는 VLM을 활용한 실시간 컨텍스트 학습을 통해 로봇 행동을 생성하고 검증하는 새로운 로봇 학습 프레임워크이다.

    Dongzhou Cheng, Taoran Yi, Ye Fang, Xingwu Zhang, Fan Feng

  3. #3Confidence Comes from Experience: Experiential Confidence Estimation from Reasoning to Agents

    XConf는 모델의 과거 경험을 기반으로 신뢰도를 추정하는 새로운 패러다임으로, 기존 추정 방식 대비 낮은 비용과 높은 정확도를 달성한다.

    Caiqi Zhang, Xiaochen Zhu, Chengzu Li, Yulong Chen, Dharshan Kumaran

  4. #4EvolveTrade: Experience-Driven Policy Refinement for Self-Evolving LLM Trading Agents

    EvolveTrade는 LLM 거래 에이전트의 정책을 거래 경험에 따라 스스로 개선하는 자가 진화 프레임워크이다.

    Sehee Kim, Yumin Choi, Minki Kang, Sung Ju Hwang

  5. #5SpectralShift: Effective Context Window Extension of Gated DeltaNet via Spectral Reparameterization

    SpectralShift는 Gated DeltaNet의 컨텍스트 확장을 위해 스펙트럼 재매개변수화를 통해 장거리 정보 전달 능력을 향상시키는 방법이다.

    Zian Liu, Yiwen Hu, Zican Dong, Tian Xie, Wayne Xin Zhao

  6. #6VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction

    VITA-1.5는 시각·언어·음성 통합을 위한 3단계 훈련 전략을 통해 실시간 멀티모달 대화를 구현한 모델이다.

    Chaoyou Fu, Haojia Lin, Xiong Wang, Yifan Zhang, Yunhang Shen

  7. #7Extreme Compression of Large Language Models via Additive Quantization

    AQLM은 2~3비트로 대규모 언어 모델을 압축하면서 정확도를 유지하는 새로운 추가 양자화 기법이다.

    Vage Egiazarian, Andrei Panferov, Denis Kuznedelev, Elias Frantar, Artem Babenko

  8. #8Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence

    Spatial-MLLM은 2D 영상 입력만으로 시각 기반 공간 지능을 향상시키는 이중 인코더-연결기 구조의 새로운 MLLM 프레임워크이다.

    Diankun Wu, Fangfu Liu, Yi-Hsin Hung, Yueqi Duan

  9. #9Infrared Small Target Detection with Scale and Location Sensitivity

    적외선 소형 타겟 탐지에서 SLS 손실과 MSHNet을 통해 기존 방법 대비 우수한 성능을 달성했다.

    Qiankun Liu, Rui Liu, Bolun Zheng, Hongkui Wang, Ying Fu

  10. #10The Good and The Bad: Exploring Privacy Issues in Retrieval-Augmented Generation (RAG)

    RAG 시스템은 검색 데이터 유출에 취약하지만, LLM 학습 데이터 유출은 줄일 수 있다는 새로운 통찰을 제시한다.

    Shenglai Zeng, Jiankun Zhang, Pengfei He, Yue Xing, Yiding Liu

  11. #11TTRL: Test-Time Reinforcement Learning

    TTRL은 라벨 없는 데이터에서 강화학습을 통해 대형 언어 모델을 테스트 시간에 자가 진화시키는 새로운 방법이다.

    Yuxin Zuo, Kaiyan Zhang, Shang Qu, Li Sheng, Xuekai Zhu

  12. #12Patchscopes: A Unifying Framework for Inspecting Hidden Representations of Language Models

    Patchscopes는 LLM 내부 표현을 해석하기 위한 통합적이고 유연한 프레임워크로, 기존 방법의 한계를 극복하고 새로운 해석 가능성과 오류 수정 기능을 제공한다.

    Asma Ghandeharioun, Avi Caciularu, Adam Pearce, Lucas Dixon, Mor Geva

  13. #13InstanceDiffusion: Instance-Level Control for Image Generation

    InstanceDiffusion은 인스턴스 수준의 위치와 속성 제어를 가능하게 하는 텍스트-이미지 생성 모델로, COCO 데이터셋에서 기존 모델 대비 20.4% AP<sub>50</sub><sup>box</sup> 및 25.4% IoU 개선을 달성했다.

    Xudong Wang, Trevor Darrell, Sai Saketh Rambhatla, Rohit Girdhar, Ishan Misra

  14. #14AnyEdit: Mastering Unified High-Quality Image Editing for Any Idea

    AnyEdit는 2.5M 개의 고질량 편집 쌍을 포함한 다모달 편집 데이터셋과 AnySD라는 새로운 통합 이미지 편집 모델을 제안하여 다양한 편집 작업에서 성능을 향상시킨다.

    Qifan Yu, Wei Chow, Zhongqi Yue, Kaihang Pan, Yang Wu

  15. #298Lecture notes on Physics Informed Neural Networks, Neural Operators, and their applications

    물리 정보 신경망과 신경 연산자의 개념 및 실제 적용을 다룬 강의 노트.

    Alessandro Bombini

  16. #303Continual Learning Mechanisms Compose for Long-Horizon Memorization

    100개의 순차적 작업 학습에서 34.9%의 최종 기억률을 달성한 복합 메커니즘 조합 연구.

    Zheyuan Zhang, Alvin Zhang, Daniel Khashabi, Tianmin Shu

  17. #304FLAT: Resampling Image and Text into 1D Flexible-Length Aligned Transmodal Tokens for Retrieval and Generation

    FLAT은 이미지와 텍스트를 1D 연속 시퀀스로 변환하여 생성과 검색을 통합하는 다중모달 학습 프레임워크로, T2I GenEval 83.1, MS-COCO BLEU-4 40.5 등 SOTA 성능을 달성한다.

    Guangyu Sun, Shlok Kumar Mishra, Wentao Bao, Robert Zhenheng Yang, Xiao Wang

  18. #308The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement

    AI가 경험을 기반으로 스스로 개선하는 RSI 개념을 제시하고, 구현 단계와 주요 도전점을 분석한다.

    Yi Duan, Ying Liu, Zirui Tang, Haodong Chen, Jun Zhou

  19. #309Zing-0.5: Toward Playable Worlds with Real-Time Joint Action and Text Control

    Zing-0.5는 실시간 키보드와 텍스트 제어를 결합한 5B 규모의 생성 세계 모델로, WBench Navigation에서 81.0의 종합 점수를 달성했다.

    Mingyang Chen, Shengdong Chen, Xiaoxiao Fu, Bosheng Gong, Haoyuan Guo

  20. #310AI for Games in the Foundation Model Era

    게임 AI 분야에서 기초 모델이 다양한 역할을 수행하며, 그간 분리되어 발전한 연구 주제들이 통합되고 있다.

    Meng Luo, Yanlin Li, Hao Li, Hongzhan Lin, Pengfei Zhou

  21. #311StepAudio 3 Realtime Technical Report

    StepAudio 3 Realtime은 Think-While-Speaking을 통해 실시간 대화 중 사고와 응답을 병행하는 오디오-언어 기반 모델로, MMSU 90.6, τ-Voice 56.0% 등 주요 지표에서 뛰어난 성능을 보인다.

    Bin Lin, Bo Zhao, Boyang Zhang, Boyong Wu, Chao Yan

  22. #312LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence

    LimiX-2는 Contextual Mechanism Networks(CMNs)를 기반으로, CCMM을 통해 학습된 다목적 테이블 데이터 지능 모델로, TabArena, TALENT, BCCO에서 기존 모델을 상회하며 인과성도 반영한다.

    Xingxuan Zhang, Gang Ren, Hao Yuan, Hao Zou, Hongze Tan

  23. #313StepAudio 3 Music Technical Report

    StepAudio 3 Music은 ABC-CoT 기반의 음악 계획과 텍스트 제어를 지원하는 대규모 장시간 음악 생성 모델이다.

    Chengli Feng, Zhiyue Wu, Jiahao Song, Zheqi Dai, Boyang Wang

  24. #314ScienceIDE: Turning World's Scientific Codebase into Agent Learnable Environments

    ScienceIDE는 과학 코드베이스를 학습 가능한 환경으로 전환하여 과학적 경험을 기반으로 AI 에이전트를 훈련하는 인프라를 제시한다.

    Hejia Geng, Zesen Huang, Haoyang Li, Wenbin Li, Koutian Wu

  25. #315Fingers as Legs: Learning Self-Supported Locomotion and Manipulation with an Anthropomorphic Hand

    인간 손 형태의 로봇이 위치 제어기를 유지하면서 이동과 조작을 동시에 학습하는 방법을 제시한다.

    Amirhossein Kazemipour, Hehui Zheng, Robert Katzschmann

  26. #316Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening

    PPO의 크리틱 학습에서 발생하는 Value Flattening 문제를 분석하고, SP^3O를 제안하여 이를 완화시킨다.

    Yizhuo Li, Jianhao Yan, Yun Luo, Zhi Wang, Futing Wang

  27. #317Generalized Agent Iteration: One Formal Framework for Iterative Policy Improvement and Recursive Self-Improvement

    GAI(Generalized Agent Iteration)는 GPI와 RSI를 하나의 학습 패러다임으로 통합하는 공식적 프레임워크를 제안한다.

    Hongyao Tang, Yi Ma, Pengyi Li, Yifu Yuan

  28. #318ProgramDistill: From Interactive Web Apps to Verifiable Reference-Guided SWE Tasks

    ProgramDistill은 실행 가능한 웹 애플리케이션에서 추출한 4,063개의 SWE 태스크로, GPT-6 Astra가 49.2% 성공률을 기록한 벤치마크이다.

    Jeonghye Kim, Minseon Kim, Young Jin Kim, Matheus Pereira, Marc-Alexandre Côté

  29. #319ActionPiece: Rethinking Action Tokenization for Autoregressive Vision-Language-Action Models

    ActionPiece는 물리적 관계를 고려한 액션 토크나이저로, VLA 모델에서 정확한 제어를 위해 PRC와 QR을 결합한 학습 방식을 제안한다.

    Shijie Lian, Bin Yu, Zhaolong Shen, Xiaopeng Lin, Yichao Du

  30. #320Agora: Git as Shared Memory for Collective AutoResearch

    Agora는 Git 기반의 공유 메모리 시스템으로, 자율 연구 에이전트 간 협업을 촉진하고 중복 탐색을 줄인다.

    Yifan Zhang, Yunheng Zou, Shaokun Zhang, Jian Hu, Hao Zhang

인기 키워드

reinforcement-learning (359) diffusion-models (209) llm (205) llm-agents (167) llm-evaluation (141) video-generation (140) transformer (136) vision-language (130) vlm (110) long-context (109) large-language-models (108) code-generation (100) benchmark-evaluation (92) long-horizon (92) benchmarking (87) language-models (85) retrieval-augmented (80) foundation-models (76) world-models (73) flow-matching (72)