HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-08-31 featured 논문 30편

  1. #1Data Scaling Laws in Imitation Learning for Robotic Manipulation

    로봇 조작에서 데이터 확장 법칙을 규명하고, 환경과 객체 다양성에 따른 정책 일반화 성능을 실증적으로 분석한다.

    Fanqi Lin, Yingdong Hu, Pingyue Sheng, Chuan Wen, Jiacheng You

  2. #3Layer by Layer: Uncovering Hidden Representations in Language Models

    중간층은 최종층보다 더 뛰어난 표현력을 가지며, 이를 정보 이론, 기하학, 불변성 기반의 통합 평가 프레임워크로 분석한다.

    Oscar Skean, Md Rifat Arefin, Dan Zhao, Niket Patel, Jalal Naghiyev

  3. #4MambaOut: Do We Really Need Mamba for Vision?*

    이미지넷 분류에서는 Mamba가 불필요하지만, 감지 및 세그멘테이션에서는 잠재력이 있다.

    Weihao Yu, Xinchao Wang

  4. #5Knowledge Conflicts for LLMs: A Survey

    이 논문은 LLM에서 발생하는 지식 충돌(Knowledge Conflicts)을 체계적으로 분류하고, 원인, 행동, 해결 전략을 조사한 서베이 논문이다.

    Rongwu Xu, Zehan Qi, Zhijiang Guo, Cunxiang Wang, Hongru Wang

  5. #6Do Llamas Work in English? On the Latent Language of Multilingual Transformers

    Llama-2 모델이 비영어 입력을 처리할 때 내부적으로 영어를 피벗 언어로 사용하는지, 이를 잠재 임베딩 공간을 분석하여 실증적으로 조사한 연구이다.

    Chris Wendler, Veniamin Veselovsky, Giovanni Monea, Robert West

  6. #7MoGe: Unlocking Accurate Monocular Geometry Estimation for Open-Domain Images with Optimal Training Supervision

    MoGe는 단일 이미지에서 정확한 3D 기하학을 추정하는 모델로, affine-invariant 표현과 ROE 정렬 알고리즘, multi-scale 로스를 통해 기존 방법 대비 35% 이상의 오류 감소를 달성한다.

    Ruicheng Wang, Sicheng Xu, Cassie Dai, Jianfeng Xiang, Yu Deng

  7. #8mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models

    mPLUG-Owl3는 초장 이미지 시퀀스를 처리하는 다중 모달 대형 언어 모델로, Hyper Attention을 도입해 시각-언어 통합 성능을 향상시킨다.

    Jiabo Ye, Haiyang Xu, Haowei Liu, Anwen Hu, Mingshi Yan

  8. #9Champ: Controllable and Consistent Human Image Animation with 3D Parametric Guidance

    CHAMP은 SMPL 모델을 기반으로 3D 파라메트릭 가이던스를 결합하여 사람 이미지 애니메이션의 형태 정렬과 움직임 지도를 향상시킨다.

    Shenhao Zhu, Junming Chen, Zuozhuo Dai, Yinghui Xu, Xun Cao

  9. #10ReEvo: Large Language Models as Hyper-Heuristics with Reflective Evolution

    ReEvo는 LLM과 진화적 탐색을 결합한 Language Hyper-Heuristics를 통해 COP 해결 성능을 향상시키는 새로운 방법이다.

    Haoran Ye, Jiarui Wang, Zhiguang Cao, Guojie Song

  10. #11An Image is Worth 32 Tokens for Reconstruction and Generation

    TiTok은 1D 이미지 토큰화를 통해 고해상도 이미지 생성을 32개 토큰으로 가능하게 하며, 기존 2D 방법 대비 410배 빠른 생성 속도를 달성한다.

    Qihang Yu, Mark Weber, Xueqing Deng, Xiaohui Shen, Daniel Cremers

  11. #316TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback

    TacForcing는 실행 중 터치 피드백을 활용한 스트리밍 액션 생성 프레임워크로, 실시간 접촉 상태 변화에 대응한다.

    Jianbo Zhou, Boyuan Zhao, Yuzheng Zhang, Yiyang Chen, Wenxin Chen

  12. #318Is Next-Chunk Reasoning RL Really Better than SFT? Revisiting Training Strategies under no-CoT Data

    Mixed SFT는 next-chunk reasoning RL보다 훨씬 저렴하면서도 높은 post-RLVR 성능을 달성한다.

    Yinhao Tang, Youqing Fang, Yanan Sun, Jiangning Liu, Ziyi Wang

  13. #319Open-MOPD: Diagnosing and Fixing Capability Imbalance in Multi-Teacher On-Policy Distillation

    Open-MOPD는 다중 전문가 정책 증류에서 발생하는 능력 불균형을 진단하고 해결하는 프레임워크로, 토큰 수준 최적화 예산의 부적절한 할당 문제를 해결하여 성능 회복률을 35.6%에서 83.4%로 향상시킨다.

    Huan-ang Gao, Haohan Chi, Yong Yan, Shiyuan Feng, Hanlin Wu

  14. #320Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds

    JoyAI-Echo-1.5는 장기적 영상 생성과 인터랙티브 월드 모델링을 위한 통합 오디오-비주얼 생성 시스템으로, 메모리, 기하학적 제어, 롤아웃 기반 학습을 결합하여 일관성과 제어력을 향상시킨다.

    Nan Duan, Haoyang Huang, Weiyang Jin, Haoran Li, Yaowei Li

  15. #321Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO

    진화 전략(Evolution Strategies, ES)이 GRPO보다 더 넓은 추론 커버리지를 제공하며, Pass@K 성능을 향상시킨다.

    Yunpeng Ba, Zhi Zheng, Yue Xie, Jiaqing Li, Xialiang Tong

  16. #322Video-IFBench: Evaluating Instruction Following of Multimodal LLMs in Video Understanding Scenarios

    Video-IFBench는 영상 이해 시 사용자 지시사항을 충족하는 다중모달 대형 언어 모델(MLLM)의 능력을 평가하는 새로운 벤치마크이다.

    Hongbo Liu, Peixian Chen, Sihan Liu, Peiyuan Zhang, Kai Zou

  17. #323V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning

    V-Rubrics는 시각적 근거성을 세부 항목 기반 강화 학습으로 향상시키는 VLM 후학습 프레임워크이다.

    Shulin Tian, Minglun Li, Yuhao Dong, Hao Ding, Jiarui Yao

  18. #324SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?

    SWE Refactor Bench는 코드 생성 에이전트가 전체 레포지토리 마이그레이션을 완료할 수 있는지 평가하는 3단계 벤치마크로, 5.4%만 모든 단계를 통과했다.

    Deyao Hong, Yizhe Chi, Wenyi Li, Xiaoqiu Wang, Mingju Gao

  19. #325WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution

    WikiSkill은 지속적인 지식 축적을 통해 에이전트의 스킬 진화를 촉진하는 프레임워크로, 다양한 벤치마크에서 기존 방법을 상회한다.

    Liyan Tang, Cyrus Rashtchian, Chun-Sung Ferng, Andrew Tomkins, Da-Cheng Juan

  20. #326The Handoff Tax: Continuing Non-Native Trajectories in LLM Agents

    LLM 에이전트에서 모델 전환 시 발생하는 비용-품질 저하 현상을 'Handoff Tax'로 명명하고, Claude와 GPT 모델을 통해 실험적으로 분석한다.

    Roy Ganz, Mor Shpigel Nacson, Adi Kalyanpur, Ron Litman

  21. #327Rubrics as Visual-Repair Context for Self-Evolving UI-to-Code Generation

    RubSE는 UI-to-code 생성 과정에서 발생하는 시각적 복구 결합 문제를 해결하기 위해 구조화된 rubric 기반 자기진화 프레임워크를 제시한다.

    Tianyi Xiong, Zhengyuan Yang, Xiaofei Wang, Chung-Ching Lin, Ruichun Ma

  22. #328Are Android GUI Agents Robust Against Runtime Anomalies? AnTrap: Evaluating Agents in Dynamic Adversarial Environments

    AnTrap은 안드로이드 GUI 에이전트의 런타임 이상 상황에서의 회복력을 체계적으로 평가하는 벤치마크로, 16개 모델이 다양한 이상 상황에 취약함을 밝혀냈다.

    Guo Gan, Yilun Zhao, Cong Chen, Jinbiao Wei, Tingyu Song

  23. #330Gated Recurrent Transformers: Expressive Depth through Recurrent Modulation

    Gated Recurrent Transformer는 재귀적 깊이를 활용해 파라미터 수를 줄이면서도 모델 성능을 유지하는 새로운 트랜스포머 구조를 제안한다.

    Amr Hegazy, Amr Alanwar, Mostafa Elhoushi

  24. #331Luce: Relightable Gaussians for 3D Asset Generation

    Luce는 이미지에서 재조명 가능한 3D 자산을 생성하기 위한 다중 모달 PBR 가우시안 표현을 제안하며, 기존 기법 대비 28% 개선된 FID 성능을 보인다.

    Mayank Singh, Michele Stoppa, Alvise Memo, Rui Yu, Harsha Kalli

  25. #332GUI-Primitives: Diagnosing Spatial Reasoning Failures in Vision-Language GUI Grounding

    GUI-Primitives는 GUI 화면에서 공간 관계를 이해하는 능력을 평가하는 대규모 벤치마크로, 기존 모델들이 공간 관계를 파악하는 데 어려움을 겪는 문제를 진단한다.

    Md Abrar Jahin, Md Rizwan Parvez

  26. #333CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes

    CritICL은 약한 모델의 실패 패턴을 활용해 강한 모델의 추론 성능을 향상시키는 추론 시 효율적인 프레임워크이다.

    Yufan Wu, Yinghui He, Zhengyi Hu, Lang Wei, Ruichen Li

  27. #334CaRGo-T: Causal Reasoning Graph-of-Thought improves Multimodal Humor Comprehension

    CaRGo-T는 멀티모달 유머 이해를 위해 인과 관계를 그래프로 표현하는 새로운 추론 프레임워크로, 기존 방법 대비 1-20% 성능 향상을 보인다.

    Abhilash Nandy, Rahul Seetharaman, Aman Bansal, Rounak Saha, Manav Nitin Kapadnis

  28. #335Magpie: Real-Time World Renderer for Interactive Games

    Magpie는 게임 엔진과 독립된 렌더 서버를 통해 실시간 생성 렌더링을 구현한 게임 시스템이다.

    Xiaoyu Zhan, Xinyu Wang, Xiaohong Zhang, Huanjie Zhu, Tengjiao Sun

  29. #336CaSKG: Counterfactual-Causal Skill Graphs for Scalable Agent Skill Retrieval

    CaSKG는 카운터패클-인과적 스킬 그래프를 통해 대규모 스킬 라이브러리에서 효과적인 스킬 검색을 가능하게 하는 프레임워크로, ALFWorld와 ScienceWorld에서 기존 방법 대비 8% 이상 성능 향상을 달성했다.

    Zhiyuan Li, Linyuan Gao, Xuechun Ding, Hongwei Chen, Yuan Wu

  30. #337Stream4D: 4D-Consistency for Streaming Autoregressive Diffusion Video Models

    Stream4D는 4D 일관성을 강화한 강화학습 기반 스트리밍 자동회귀 확산 영상 모델 훈련 프레임워크로, 4D-PSNR 6.76 dB 개선을 달성한다.

    Yuanhao Ban, Jiaqi Feng, Hengguang Zhou, Xiaohuan Pei, Justin Cui

인기 키워드

reinforcement-learning (331) diffusion-models (190) llm (190) llm-agents (160) video-generation (129) transformer (126) llm-evaluation (125) vision-language (112) vlm (109) long-context (99) large-language-models (94) code-generation (88) long-horizon (86) benchmark-evaluation (82) benchmarking (80) language-models (75) retrieval-augmented (73) flow-matching (68) world-models (68) foundation-models (67)