HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-08-30 featured 논문 30편

  1. #2Behavior Generation with Latent Actions

    VQ-BeT는 행동 생성에서 다중 모드를 효과적으로 포착하고 추론 속도를 5배 향상시키는 행동 생성 모델이다.

    Seungjae Lee, Yibin Wang, Haritheja Etukuru, H. J. Kim, Nur Muhammad

  2. #3Perception Encoder: The best visual embeddings are not at the output of the network

    Perception Encoder는 단일 대비 학습만으로 이미지와 영상 인식, Q&A, 객체 탐지 등 다양한 작업에서 최고 성능을 달성한 시각 인코더이다.

    Daniel Bolya, Po-Yao Huang, Peize Sun, J. Cho, Andrea Madotto

  3. #4Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models

    Visual Sketchpad는 시각적 사고 체인을 통해 멀티모달 언어 모델의 추론 능력을 향상시키는 프레임워크이다.

    Yushi Hu, Weijia Shi, Xingyu Fu, Dan Roth, Mari Ostendorf

  4. #5MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark

    MMAU는 10,000개의 음성-질의-답변 쌍을 포함한, 음성 이해 및 추론 능력을 평가하는 새로운 벤치마크로, 최신 모델들이 53% 미만의 정확도를 기록하며 기술적 한계를 드러낸다.

    S. Sakshi, Utkarsh Tyagi, Sonal Kumar, Ashish Seth, S Ramaneswaran

  5. #6Time-MoE: Billion-Scale Time Series Foundation Models with Mixture of Experts

    Time-MoE는 2.4억 파라미터 규모의 MoE 기반 디코더-온리 트랜스포머로, 3000억 이상의 Time-300B 데이터셋에서 사전 학습하여 시간 시리즈 예측 성능을 대폭 향상시킨다.

    X. Shi, Shiyu Wang, Yuqi Nie, Dianqi Li, Zhou Ye

  6. #7OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation

    OpenVid-1M은 100만 개 이상의 고품질 텍스트-비디오 쌍을 포함한 대규모 데이터셋으로, MVDiT라는 새로운 다중 모달 디퓨전 트랜스포머를 제안하여 텍스트-비디오 생성을 개선한다.

    Kepan Nan, Rui Xie, Penghao Zhou, Tiehan Fan, Zhenheng Yang

  7. #8Improving Alignment and Robustness with Circuit Breakers

    "Representation Rerouting" 기반의 Circuit Breakers가 LLM과 멀티모달 모델의 해로운 출력을 억제하면서도 성능 저하 없이 공격에 강한 안정성을 제공한다.

    Andy Zou, Long Phan, Justin Wang, Derek Duenas, Maxwell Lin

  8. #9Evolution of Heuristics: Towards Efficient Automatic Algorithm Design Using Large Language Model

    EoH는 LLM과 EC를 결합해 휴리스틱을 자동 생성하며, 휴리스틱 아이디어와 코드를 진화시켜 효율적인 알고리즘 설계를 가능하게 한다.

    Fei Liu, Xialiang Tong, Mingxuan Yuan, Xi Lin, Fu Luo

  9. #10Learning to (Learn at Test Time): RNNs with Expressive Hidden States

    TTT 레이어는 테스트 시점에 학습하는 RNN 구조로, 긴 문맥에서 성능을 유지하면서도 선형 복잡도를 달성한다.

    Yu Sun, Xinhao Li, Karan Dalal, Jiarui Xu, Arjun Vikram

  10. #11MACE: Mass Concept Erasure in Diffusion Models

    MACE는 100개 이상의 개념을 확장적으로 제거하면서 일반성과 특이성을 균형 있게 유지하는 텍스트-이미지 디퓨전 모델 개념 제거 프레임워크이다.

    Shilin Lu, Zilan Wang, Leyang Li, Yanzhu Liu, A. Kong

  11. #187Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization

    Zero-WAM은 인-컨텍스트 학습을 기반으로 인간 동영상에서 무작위 작업을 추론해 수행하는 로봇 정책을 제시한다.

    Jiaming Zhou, Qihang Zhang, Gangwei Xu, Cunxin Fan, Yujie Zhao

  12. #286PAWBench: How Far Are We from Probabilistically Aligned World Modeling?

    PAWBench는 영상 생성 모델이 확률적으로 정렬된 세계 모델링에 얼마나 가까운지를 평가하는 벤치마크로, 50개 시나리오에서 기존 11개 시스템이 모두 일관된 분포를 재현하지 못함을 밝힘.

    Yuandong Pu, Le Zhuo, Sayak Paul, Gabriel Jorge Menezes, Avram Đorđević

  13. #305Procedura: Agentic 3D Modeling with Procedural Control

    Procedura는 텍스트 프롬프트를 기반으로 3D 모델을 프로시저적 어셈블리 형태로 생성하는 에이전트 프레임워크로, 정밀한 기하 구조와 편집 가능한 파트 분해를 실현한다.

    Youtian Lin, Yikang Yang, Zhanpeng Hu, Mengqi Zhou, Feihu Zhang

  14. #307Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling World Models

    게임 개발을 기반으로 한 RLHEV 학습 패러다임이 세계 모델 확장에 효과적인 검증 가능한 데이터 엔진으로 제시된다.

    Pengfei Zhou, Hexin Wang, Zhengfeiyang Zhang, Yixing Ma, Zhenglin Wan

  15. #310UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City

    UrbanGround는 홍콩의 실제 3D 지리 데이터를 기반으로 MLLM 에이전트의 도시 내 지속적 탐색 능력을 평가하는 첫 번째 샌드박스 환경이다.

    Tianjie Ju, Zheng Wu, Yueqing Sun, Yuhan Cui, Bobo Li

  16. #311TTPO: Test-Time Policy Optimization

    TTPO는 라벨 없이도 수학적 추론 성능을 향상시키는 테스트 타임 정책 최적화 방법으로, Qwen3-1.7B 모델에서 38.0%에서 45.2%로 정확도를 높인다.

    Aozhe Wang, Zhengxi Lu, Jianze Wang, Shangke Lv, Ying Liu

  17. #312Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher

    Self-OPD는 교사 모델 없이 흐름 일치 모델에 온-폴리시 디스틸레이션을 적용한 새로운 프레임워크로, K개의 SDE 후보 분기와 정규화된 이점을 기반으로 속도장 최적화를 수행한다.

    Shiyi Zhang, Mushui Liu, Yunze Tong, Wanggui He, Siyu Zou

  18. #313What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents

    LLM 에이전트의 생성 데이터를 ACE(정확도-복잡도-다양성) 관점에서 분석하고, (E,q,τ,v) 요소로 분해하여 생성 프레임워크를 제시한다.

    Xingshan Zeng, Zishan Xu, Boju Zhang, Yuzhou Wu, Lingzhi Wang

  19. #314MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization

    MA-VLA는 다팔 협업을 위한 구조화된 원-모델 VLA 프레임워크로, Arm Shuffle를 통해 새로운 협업 패턴으로의 일반화를 달성한다.

    Zaibin Zhang, Junlan Xiao, Zhongbo Zhang, Yifan Wang, Li Kang

  20. #315FU-Mamba: A Frequency-Enhanced Dynamic Scanning Framework for Oralscan Image Segmentation

    FU-Mamba는 동적 스캐닝과 주파수 영역 강화를 결합한 구강 이미지 세그멘테이션 프레임워크로, mIoU 1.1% 개선을 달성했다.

    Xinxin Zhao, Jinpeng Ye, Bo Wei, Liqin Wu, Mahmoud Hassaballah

  21. #316Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report

    HAT은 실시간 라이브 스트리밍에 적합한 컴팩트 모델을 Harness 변화에 적응하도록 훈련하는 방법으로, 라이브 QA 정확도 94.8, P50 3.4초 달성.

    TaoLive AIGC LLM Team, Yuhan Sun, Wenhao Lin, Yongdong Luo, Yibo Hu

  22. #317GameWAM: A World Action Model for Video Games

    GameWAM은 비디오 게임에서 시각적 미래와 실행 가능한 키보드-마우스 동작을 병렬 생성하는 최초의 World-Action Model이다.

    Yuncheng Guo, Zhanqiu Zhang, Yiwen Guo, Weijia Li

  23. #318TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback

    TacForcing는 실행 중 터치 피드백을 활용한 스트리밍 액션 생성 프레임워크로, 실시간 접촉 상태 변화에 대응한다.

    Jianbo Zhou, Boyuan Zhao, Yuzheng Zhang, Yiyang Chen, Wenxin Chen

  24. #319PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents

    PILOT은 실시간 자기 개선을 통해 장기적 작업 성능을 향상시키는 감독자-작업자 구조의 에이전트 허네스이다.

    Yang Xiao, Yusong Sun, Haoyi Wu, Wenyang Hui, Wen Da

  25. #320Is Next-Chunk Reasoning RL Really Better than SFT? Revisiting Training Strategies under no-CoT Data

    Mixed SFT는 next-chunk reasoning RL보다 훨씬 저렴하면서도 높은 post-RLVR 성능을 달성한다.

    Yinhao Tang, Youqing Fang, Yanan Sun, Jiangning Liu, Ziyi Wang

  26. #321Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds

    JoyAI-Echo-1.5는 장기적 영상 생성과 인터랙티브 월드 모델링을 위한 통합 오디오-비주얼 생성 시스템으로, 메모리, 기하학적 제어, 롤아웃 기반 학습을 결합하여 일관성과 제어력을 향상시킨다.

    Nan Duan, Haoyang Huang, Weiyang Jin, Haoran Li, Yaowei Li

  27. #322Open-MOPD: Diagnosing and Fixing Capability Imbalance in Multi-Teacher On-Policy Distillation

    Open-MOPD는 다중 전문가 정책 증류에서 발생하는 능력 불균형을 진단하고 해결하는 프레임워크로, 토큰 수준 최적화 예산의 부적절한 할당 문제를 해결하여 성능 회복률을 35.6%에서 83.4%로 향상시킨다.

    Huan-ang Gao, Haohan Chi, Yong Yan, Shiyuan Feng, Hanlin Wu

  28. #323Video-IFBench: Evaluating Instruction Following of Multimodal LLMs in Video Understanding Scenarios

    Video-IFBench는 영상 이해 시 사용자 지시사항을 충족하는 다중모달 대형 언어 모델(MLLM)의 능력을 평가하는 새로운 벤치마크이다.

    Hongbo Liu, Peixian Chen, Sihan Liu, Peiyuan Zhang, Kai Zou

  29. #324Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO

    진화 전략(Evolution Strategies, ES)이 GRPO보다 더 넓은 추론 커버리지를 제공하며, Pass@K 성능을 향상시킨다.

    Yunpeng Ba, Zhi Zheng, Yue Xie, Jiaqing Li, Xialiang Tong

  30. #325V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning

    V-Rubrics는 시각적 근거성을 세부 항목 기반 강화 학습으로 향상시키는 VLM 후학습 프레임워크이다.

    Shulin Tian, Minglun Li, Yuhao Dong, Hao Ding, Jiarui Yao

인기 키워드

reinforcement-learning (331) diffusion-models (190) llm (190) llm-agents (160) video-generation (129) transformer (126) llm-evaluation (125) vision-language (112) vlm (109) long-context (99) large-language-models (94) code-generation (88) long-horizon (86) benchmark-evaluation (82) benchmarking (80) language-models (75) retrieval-augmented (73) flow-matching (68) world-models (68) foundation-models (67)