HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-08-29 featured 논문 30편

  1. #1TSLANet: Rethinking Transformers for Time Series Representation Learning

    TSLANet은 시계열 분석을 위한 경량화된 적응형 컨볼루션 네트워크로, Transformer 대비 정확도와 계산 효율성을 동시에 향상시킨다.

    Emadeldeen Eldele, Mohamed Ragab, Zhenghua Chen, Min Wu, Xiaoli Li

  2. #2RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete

    RoboBrain은 ShareRobot 데이터셋을 기반으로, 로봇 조작의 추상적 지시를 구체적 행동으로 변환하는 통합 MLLM 모델로, 기존 모델 대비 14.6~18.75% 성능 향상.

    Yuheng Ji, Huajie Tan, Jiayu Shi, Xiaoshuai Hao, Yuan Zhang

  3. #3WarpSAC: Towards the Pinnacle of Scalable Off-policy RL by Rethinking Exploration and Exploitation

    WarpSAC는 데이터 규모에 따라 안정화 기법을 조정함으로써, 확장 가능한 오프-정책 강화학습의 성능을 4.5%~23.1% 개선하는 알고리즘 패밀리이다.

    Zihao Wu, Hongyao Tang, Yi Ma, Huizhong Song, Pengyi Li

  4. #4Large Models for Battery Prognostics and Health Management: A Review and Future Roadmap

    대규모 모델(LMs)이 배터리 상태 예측 및 관리(BPHM) 분야에서 기존 한계를 극복할 잠재력을 보여주며, 새로운 연구 방향을 제시한다.

    Jiale Liu, Huan Wang, Weicheng Wang, Rong Zhu, Qiqi Wang

  5. #5FedCMAPSS: A Benchmark for Federated Learning in Remaining Useful Life Estimation

    FedCMAPSS는 연방 학습 기반 RUL 추정 연구를 위한 표준 벤치마크를 제시한다.

    Amelia Sorrenti, Matteo Pennisi, Concetto Spampinato, Simone Palazzo

  6. #6Evaluation and Benchmarking of LLM Agents: A Survey

    LLM 에이전트 평가의 현황과 주요 과제를 체계적으로 정리한 서베이 논문.

    Mahmoud Mohammadi, Yipeng Li, Jean-Pierre Lo, W. Yip

  7. #7GeoWizard: Unleashing the Diffusion Priors for 3D Geometry Estimation from a Single Image

    GeoWizard는 단일 이미지로부터 깊이와 노멀을 추정하는 생성 모델로, 디퓨전 프라이어와 기하학 스위처를 활용해 정밀도와 일반화 능력을 향상시킨다.

    Xiao Fu, Wei Yin, Mu Hu, Kaixuan Wang, Yuexin Ma

  8. #8LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding

    LongVU는 장시간 동영상 이해를 위해 시공간 적응형 압축 기법을 도입한 MLLM 모델로, DINOv2와 텍스트 유도 쿼리를 활용해 토큰 수를 줄이며 정확도를 유지한다.

    Xiaoqian Shen, Yunyang Xiong, Changsheng Zhao, Lemeng Wu, Jun Chen

  9. #9Large Language Models for Data Annotation and Synthesis: A Survey

    GPT-4 기반 대형 언어 모델을 활용한 데이터 어노테이션 및 합성에 대한 체계적 서베이.

    Zhen Tan, Dawei Li, Song Wang, Alimohammad Beigi, Bohan Jiang

  10. #10PiSSA: Principal Singular Values and Singular Vectors Adaptation of Large Language Models

    PiSSA는 LoRA보다 빠르고 성능이 우수한 대형 언어 모델 미세조정 기법으로, 주성분 기반 초기화와 잔여 성분 고정을 통해 70B 모델에서도 86.05% 정확도를 달성한다.

    Fanxu Meng, Zhaohui Wang, Muhan Zhang

  11. #11G-Retriever: Retrieval-Augmented Generation for Textual Graph Understanding and Question Answering

    G-Retriever는 텍스트 속성 그래프에서 질의 응답을 위한 RAG 기반 프레임워크로, hallucination 저감과 확장성을 실현한다.

    Xiaoxin He, Yijun Tian, Yifei Sun, N. Chawla, T. Laurent

  12. #12ReFT: Reasoning with Reinforced Fine-Tuning

    ReFT는 수학 문제 해결을 위한 LLM 학습에서 PPO 기반 강화 학습을 활용해 SFT 대비 75.28%의 정확도를 달성한 새로운 미세조정 방법이다.

    Trung Quoc Luong, Xinbo Zhang, Zhanming Jie, Peng Sun, Xiaoran Jin

  13. #13Discrete Flow Matching

    Discrete Flow Matching은 비자동회귀 방식으로 높은 품질의 이산 데이터를 생성하는 새로운 이산 흐름 모델링 기법이다.

    Itai Gat, Tal Remez, Neta Shaul, F. Kreuk, Ricky T. Q. Chen

  14. #246Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization

    Zero-WAM은 인-컨텍스트 학습을 기반으로 인간 동영상에서 무작위 작업을 추론해 수행하는 로봇 정책을 제시한다.

    Jiaming Zhou, Qihang Zhang, Gangwei Xu, Cunxin Fan, Yujie Zhao

  15. #292PAWBench: How Far Are We from Probabilistically Aligned World Modeling?

    PAWBench는 영상 생성 모델이 확률적으로 정렬된 세계 모델링에 얼마나 가까운지를 평가하는 벤치마크로, 50개 시나리오에서 기존 11개 시스템이 모두 일관된 분포를 재현하지 못함을 밝힘.

    Yuandong Pu, Le Zhuo, Sayak Paul, Gabriel Jorge Menezes, Avram Đorđević

  16. #306VGI-BENCH: Probing Visual Intelligence in Video Generation Models

    VGI-Bench는 영상 생성 모델의 시각적 추론 능력을 평가하기 위한 새로운 벤치마크로, Seedance 2.0 모델이 51.0% 성능을 기록하는 등 현재 모델들의 한계를 드러낸다.

    Xuan He, Cong Wei, Yuhao Cheng, Linrui Ma, Yuxuan Zhang

  17. #307VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction

    VoiceMem은 실시간 음성 대화 시스템에 정보와 감정 메모리를 결합한 스트리밍 듀얼 브레인 메모리 프레임워크이다.

    Zhifei Xie, Jiaqi Lang, Ze An, Yifan Zhao, Dongchao Yang

  18. #308Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling World Models

    게임 개발을 기반으로 한 RLHEV 학습 패러다임이 세계 모델 확장에 효과적인 검증 가능한 데이터 엔진으로 제시된다.

    Pengfei Zhou, Hexin Wang, Zhengfeiyang Zhang, Yixing Ma, Zhenglin Wan

  19. #309JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution

    JIT-Agent는 임의의 LLM에 실시간으로 최적화된 agent harness를 생성하여 성능을 대폭 향상시킨다.

    Guibin Zhang, Leo Lu, Fangzhou Xie, Kang Zhu, Junhao Wang

  20. #310StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models

    StreamPI는 기존 단일 프레임 VLA 모델에 시간 정보를 추가하면서 추가 파라미터 없이 실시간 추론을 가능하게 하는 스트리밍 멀티모달 시간 모델링 프레임워크이다.

    Zhe Liu, Jinghua Hou, Yuxiang Lu, Zhenya Yang, Xianzhe Fan

  21. #311UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City

    UrbanGround는 홍콩의 실제 3D 지리 데이터를 기반으로 MLLM 에이전트의 도시 내 지속적 탐색 능력을 평가하는 첫 번째 샌드박스 환경이다.

    Tianjie Ju, Zheng Wu, Yueqing Sun, Yuhan Cui, Bobo Li

  22. #312Procedura: Agentic 3D Modeling with Procedural Control

    Procedura는 텍스트 프롬프트를 기반으로 3D 모델을 프로시저적 어셈블리 형태로 생성하는 에이전트 프레임워크로, 정밀한 기하 구조와 편집 가능한 파트 분해를 실현한다.

    Youtian Lin, Yikang Yang, Zhanpeng Hu, Mengqi Zhou, Feihu Zhang

  23. #313TTPO: Test-Time Policy Optimization

    TTPO는 라벨 없이도 수학적 추론 성능을 향상시키는 테스트 타임 정책 최적화 방법으로, Qwen3-1.7B 모델에서 38.0%에서 45.2%로 정확도를 높인다.

    Aozhe Wang, Zhengxi Lu, Jianze Wang, Shangke Lv, Ying Liu

  24. #314FU-Mamba: A Frequency-Enhanced Dynamic Scanning Framework for Oralscan Image Segmentation

    FU-Mamba는 동적 스캐닝과 주파수 영역 강화를 결합한 구강 이미지 세그멘테이션 프레임워크로, mIoU 1.1% 개선을 달성했다.

    Xinxin Zhao, Jinpeng Ye, Bo Wei, Liqin Wu, Mahmoud Hassaballah

  25. #315Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher

    Self-OPD는 교사 모델 없이 흐름 일치 모델에 온-폴리시 디스틸레이션을 적용한 새로운 프레임워크로, K개의 SDE 후보 분기와 정규화된 이점을 기반으로 속도장 최적화를 수행한다.

    Shiyi Zhang, Mushui Liu, Yunze Tong, Wanggui He, Siyu Zou

  26. #316What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents

    LLM 에이전트의 생성 데이터를 ACE(정확도-복잡도-다양성) 관점에서 분석하고, (E,q,τ,v) 요소로 분해하여 생성 프레임워크를 제시한다.

    Xingshan Zeng, Zishan Xu, Boju Zhang, Yuzhou Wu, Lingzhi Wang

  27. #317MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization

    MA-VLA는 다팔 협업을 위한 구조화된 원-모델 VLA 프레임워크로, Arm Shuffle를 통해 새로운 협업 패턴으로의 일반화를 달성한다.

    Zaibin Zhang, Junlan Xiao, Zhongbo Zhang, Yifan Wang, Li Kang

  28. #318Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report

    HAT은 실시간 라이브 스트리밍에 적합한 컴팩트 모델을 Harness 변화에 적응하도록 훈련하는 방법으로, 라이브 QA 정확도 94.8, P50 3.4초 달성.

    TaoLive AIGC LLM Team, Yuhan Sun, Wenhao Lin, Yongdong Luo, Yibo Hu

  29. #319GameWAM: A World Action Model for Video Games

    GameWAM은 비디오 게임에서 시각적 미래와 실행 가능한 키보드-마우스 동작을 병렬 생성하는 최초의 World-Action Model이다.

    Yuncheng Guo, Zhanqiu Zhang, Yiwen Guo, Weijia Li

  30. #320PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents

    PILOT은 실시간 자기 개선을 통해 장기적 작업 성능을 향상시키는 감독자-작업자 구조의 에이전트 허네스이다.

    Yang Xiao, Yusong Sun, Haoyi Wu, Wenyang Hui, Wen Da

인기 키워드

reinforcement-learning (331) diffusion-models (190) llm (190) llm-agents (160) video-generation (129) transformer (126) llm-evaluation (125) vision-language (112) vlm (109) long-context (99) large-language-models (94) code-generation (88) long-horizon (86) benchmark-evaluation (82) benchmarking (80) language-models (75) retrieval-augmented (73) flow-matching (68) world-models (68) foundation-models (67)