HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-09-19 featured 논문 30편

  1. #1In-Context Robot Learning with VLM Agents

    GPT-Policy는 VLM을 활용한 실시간 컨텍스트 학습을 통해 로봇 행동을 생성하고 검증하는 새로운 로봇 학습 프레임워크이다.

    Dongzhou Cheng, Taoran Yi, Ye Fang, Xingwu Zhang, Fan Feng

  2. #2Identity-Preserving Text-To-Video Generation by Frequency Decomposition

    ConsisID는 주어진 텍스트에 따라 생성된 동영상에서 인물의 정체성을 유지하는 데, 주파수 분해를 기반으로 하는 DiT 기반 컨트롤 방식을 제안한다.

    Shenghai Yuan, Jinfa Huang, Xianyi He, Yunyuan Ge, Yujun Shi

  3. #3Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning

    VPL(Variational Preference Learning)을 통해 개인별 선호를 반영한 다중 모달 RLHF를 구현하고, 다양한 사용자 집단의 정확한 보상 모델링을 실현한다.

    S. Poddar, Yanming Wan, Hamish Ivison, Abhishek Gupta, Natasha Jaques

  4. #4DUET: Dual Clustering Enhanced Multivariate Time Series Forecasting

    DUET는 시간과 채널 차원의 이중 클러스터링을 통해 다변량 시계열 예측 성능을 향상시키는 새로운 프레임워크이다.

    Xiangfei Qiu, Xingjian Wu, Yan Lin, Chenjuan Guo, Jilin Hu

  5. #5SpectralShift: Effective Context Window Extension of Gated DeltaNet via Spectral Reparameterization

    SpectralShift는 Gated DeltaNet의 컨텍스트 확장을 위해 스펙트럼 재매개변수화를 통해 장거리 정보 전달 능력을 향상시키는 방법이다.

    Zian Liu, Yiwen Hu, Zican Dong, Tian Xie, Wayne Xin Zhao

  6. #6MegaSaM: Accurate, Fast, and Robust Structure and Motion from Casual Dynamic Videos

    MegaSaM은 동적 장면의 비구조화 단일 카메라 영상에서 정확하고 빠르게 카메라 파라미터와 깊이 맵을 추정하는 시스템이다.

    Zhengqi Li, Richard Tucker, Forrester Cole, Qianqian Wang, Linyi Jin

  7. #7ShowUI: One Vision-Language-Action Model for GUI Visual Agent

    ShowUI는 UI-가이드 토큰 선택, 인터리브 스트리밍, 고품질 데이터셋을 결합한 2B 파라미터 GUI 시각 에이전트 모델로, 75.1%의 제로샷 정확도를 달성한다.

    Kevin Qinghong Lin, Linjie Li, Difei Gao, Zhengyuan Yang, Shiwei Wu

  8. #8Pathformer: Multi-scale Transformers with Adaptive Pathways for Time Series Forecasting

    Pathformer는 다양한 시간 스케일의 시계열 패턴을 적응적으로 모델링하는 다중 스케일 트랜스포머 모델로, 11개 실제 데이터셋에서 기존 모델을 초과하는 성능을 보인다.

    Peng Chen, Yingying Zhang, Yunyao Cheng, Yang Shu, Yihang Wang

  9. #9HelpSteer2: Open-source dataset for training top-performing reward models

    HelpSteer2는 10,000개의 응답 쌍으로 구성된 오픈소스 퍼포먼스 데이터셋으로, SteerLM 2.0과 함께 사용 시 Reward-Bench에서 92.0%의 최고 성능을 달성한다.

    Zhilin Wang, Yi Dong, Olivier Delalleau, Jiaqi Zeng, Gerald Shen

  10. #10SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal Behaviors

    SORRY-Bench는 LLM의 안전 거부 능력을 체계적으로 평가하기 위한 새로운 벤치마크로, 44개 주제, 8.8K 개의 언어 변형, 7K+ 인간 라벨을 기반으로 설계되었다.

    Tinghao Xie, Xiangyu Qi, Yi Zeng, Yangsibo Huang, Udari Madhushani Sehwag

  11. #11VideoLLM-online: Online Video Large Language Model for Streaming Video

    VideoLLM-online은 실시간 동영상 스트리밍 대화를 지원하는 LIVE 프레임워크를 기반으로 구축된 모델로, 10 FPS 이상의 처리 속도와 뛰어난 오프라인 벤치마크 성능을 보인다.

    Joya Chen, Zhaoyang Lv, Shiwei Wu, Kevin Qinghong Lin, Chenan Song

  12. #12RedPajama: an Open Dataset for Training Large Language Models

    RedPajama는 100조 토큰 이상의 오픈 소스 대형 언어 모델 학습 데이터셋으로, 투명성과 품질 신호를 통해 모델 성능을 개선한다.

    Maurice Weber, Dan Fu, Quentin Anthony, Yonatan Oren, Shane Adams

  13. #303Zing-0.5: Toward Playable Worlds with Real-Time Joint Action and Text Control

    Zing-0.5는 실시간 키보드와 텍스트 제어를 결합한 5B 규모의 생성 세계 모델로, WBench Navigation에서 81.0의 종합 점수를 달성했다.

    Mingyang Chen, Shengdong Chen, Xiaoxiao Fu, Bosheng Gong, Haoyuan Guo

  14. #304LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence

    LimiX-2는 Contextual Mechanism Networks(CMNs)를 기반으로, CCMM을 통해 학습된 다목적 테이블 데이터 지능 모델로, TabArena, TALENT, BCCO에서 기존 모델을 상회하며 인과성도 반영한다.

    Xingxuan Zhang, Gang Ren, Hao Yuan, Hao Zou, Hongze Tan

  15. #305ScienceIDE: Turning World's Scientific Codebase into Agent Learnable Environments

    ScienceIDE는 과학 코드베이스를 학습 가능한 환경으로 전환하여 과학적 경험을 기반으로 AI 에이전트를 훈련하는 인프라를 제시한다.

    Hejia Geng, Zesen Huang, Haoyang Li, Wenbin Li, Koutian Wu

  16. #306PACT: Can Enterprise AI Assistants Be Trusted Under Pressure?

    PACT는 기업 AI 어시스턴트의 규정 준수를 압박 상황에서 평가하는 벤치마크로, 22개 모델의 6~10% 규칙 위반과 65% 평균 위반 증가를 보여준다.

    Mika Okamoto, Ansel Kaplan Erol

  17. #307ActionPiece: Rethinking Action Tokenization for Autoregressive Vision-Language-Action Models

    ActionPiece는 물리적 관계를 고려한 액션 토크나이저로, VLA 모델에서 정확한 제어를 위해 PRC와 QR을 결합한 학습 방식을 제안한다.

    Shijie Lian, Bin Yu, Zhaolong Shen, Xiaopeng Lin, Yichao Du

  18. #308Fingers as Legs: Learning Self-Supported Locomotion and Manipulation with an Anthropomorphic Hand

    인간 손 형태의 로봇이 위치 제어기를 유지하면서 이동과 조작을 동시에 학습하는 방법을 제시한다.

    Amirhossein Kazemipour, Hehui Zheng, Robert Katzschmann

  19. #309Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening

    PPO의 크리틱 학습에서 발생하는 Value Flattening 문제를 분석하고, SP^3O를 제안하여 이를 완화시킨다.

    Yizhuo Li, Jianhao Yan, Yun Luo, Zhi Wang, Futing Wang

  20. #310SCOUT: Sim-to-Real Text-Based Person Retrieval by Embedding-Space Prediction over Frozen Video Features

    SCOUT은 고정된 인코더를 사용해 시뮬레이션-실제 갭에서 텍스트 기반 인물 검색을 수행하며, AI City Challenge 2026에서 84.25 mAP@10 성능을 달성한다.

    Abdarahmane Traoré, Andy Couturier, Éric Hervet

  21. #311Confidence Comes from Experience: Experiential Confidence Estimation from Reasoning to Agents

    XConf는 모델의 과거 경험을 기반으로 신뢰도를 추정하는 새로운 패러다임으로, 기존 추정 방식 대비 낮은 비용과 높은 정확도를 달성한다.

    Caiqi Zhang, Xiaochen Zhu, Chengzu Li, Yulong Chen, Dharshan Kumaran

  22. #312DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression

    DeepSeek-V4.1-Flash는 KV 캐시 압축 기술을 통해 1M 토큰 컨텍스트를 처리하는 552B 파라미터 MoE 모델로, KV 캐시 용량을 기존 모델 대비 1/4~1/8로 줄였다.

    DeepSeek-AI, :, Anyi Xu, B. Li, Bangcai Lin

  23. #313ProgramDistill: From Interactive Web Apps to Verifiable Reference-Guided SWE Tasks

    ProgramDistill은 실행 가능한 웹 애플리케이션에서 추출한 4,063개의 SWE 태스크로, GPT-6 Astra가 49.2% 성공률을 기록한 벤치마크이다.

    Jeonghye Kim, Minseon Kim, Young Jin Kim, Matheus Pereira, Marc-Alexandre Côté

  24. #314Agora: Git as Shared Memory for Collective AutoResearch

    Agora는 Git 기반의 공유 메모리 시스템으로, 자율 연구 에이전트 간 협업을 촉진하고 중복 탐색을 줄인다.

    Yifan Zhang, Yunheng Zou, Shaokun Zhang, Jian Hu, Hao Zhang

  25. #315SoL-Pi: Recursively Scaling Auto-Research Loops for Efficient Agent Harness

    SoL-Pi는 자동 연구 루프를 통해 토큰 효율성을 44.7–49.0% 개선한 에이전트 헤이버스 시스템이다.

    Haozhe Liu, Tian Ye, Sensen Gao, Qihang Cao, Yitong Li

  26. #316An Empirical Study of Harness Design for Coding Agents

    코드 생성 에이전트의 하네스 성능을 모듈별로 분석한 실험 연구.

    Run-Ze Fan, Zihao Zhang, Simin Ma, Yebowen Hu, Shouju Wang

  27. #317VC-Attention: Value Smoothing and Softmax Casting for Low-bit Attention

    VC-Attention은 비트 수를 줄인 상태에서 정확도와 속도를 동시에 향상시키는 트레이닝 없는 어텐션 기법이다.

    Xingyang Li, Dongyun Zou, Shining Zhang, Jiacheng Chen, Haocheng Xi

  28. #318Generalized Agent Iteration: One Formal Framework for Iterative Policy Improvement and Recursive Self-Improvement

    GAI(Generalized Agent Iteration)는 GPI와 RSI를 하나의 학습 패러다임으로 통합하는 공식적 프레임워크를 제안한다.

    Hongyao Tang, Yi Ma, Pengyi Li, Yifu Yuan

  29. #319EvolveTrade: Experience-Driven Policy Refinement for Self-Evolving LLM Trading Agents

    EvolveTrade는 LLM 거래 에이전트의 정책을 거래 경험에 따라 스스로 개선하는 자가 진화 프레임워크이다.

    Sehee Kim, Yumin Choi, Minki Kang, Sung Ju Hwang

  30. #320HypoEvolve: Genetic Algorithms Enable Multi-Agent LLMs to Discover Scientific Hypotheses

    HypoEvolve는 과학적 가설의 질을 향상시키기 위해 유전 알고리즘을 활용한 다 에이전트 LLM 시스템이다.

    Jieyuan Liu, Mengzhou Hu, Jefferson Chen, JungHo Kong, Pratibha Jagannatha

인기 키워드

reinforcement-learning (360) diffusion-models (209) llm (205) llm-agents (167) video-generation (142) llm-evaluation (141) transformer (137) vision-language (131) long-context (111) large-language-models (110) vlm (110) code-generation (100) benchmark-evaluation (92) long-horizon (92) benchmarking (87) language-models (85) retrieval-augmented (80) foundation-models (77) world-models (73) flow-matching (72)