HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-09-05 featured 논문 30편

  1. #1PhysGen: Rigid-Body Physics-Grounded Image-to-Video Generation

    PhysGen은 단일 이미지와 물리 조건을 입력으로 받아, 현실적이고 물리적으로 타당한 동영상을 생성하는 이미지-투-비디오 생성 시스템이다.

    Shaowei Liu, Zhongzheng Ren, Saurabh Gupta, Shenlong Wang

  2. #2MA-LMM: Memory-Augmented Large Multimodal Model for Long-Term Video Understanding

    MA-LMM은 장기 동영상 이해를 위해 메모리 은행을 도입한 오프라인 방식의 대규모 멀티모달 모델이다.

    Bo He, Hengduo Li, Young Kyun Jang, Menglin Jia, Xuefei Cao

  3. #3DepthSplat: Connecting Gaussian Splatting and Depth

    DepthSplat은 Gaussian splatting과 depth estimation을 결합하여 ScanNet, RealEstate10K, DL3DV에서 최고 성능을 달성한 통합 모델이다.

    Haofei Xu, Songyou Peng, Fangjinhua Wang, Hermann Blum, Dániel Baráth

  4. #4UltraEdit: Instruction-based Fine-Grained Image Editing at Scale

    UltraEdit는 400만 개 이상의 자동 생성된 지시 기반 이미지 편집 샘플을 포함한 대규모 고질량 데이터셋으로, 기존 문제를 해결한 시스템적 생성 파이프라인을 제시한다.

    Haozhe Zhao, Xiaojian Ma, Liang Chen, Shuzheng Si, Rujie Wu

  5. #5Recammaster: Camera-Controlled Generative Rendering From a Single Video

    ReCamMaster는 단일 영상에서 카메라 제어를 통해 새로운 시점의 동영상을 생성하는 생성적 렌더링 프레임워크이다.

    Jianhong Bai, Menghan Xia, Xiao Fu, Xintao Wang, Lianrui Mu

  6. #6VisionZip: Longer is Better but Not Necessary in Vision Language Models

    VisionZip은 시각 토큰의 중복을 줄여 모델 성능을 유지하면서 추론 속도를 8× 향상시키는 간단한 방법이다.

    Senqiao Yang, Yukang Chen, Zhuotao Tian, Chengyao Wang, Jingyao Li

  7. #7Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free

    Gated Attention을 통해 SDPA 출력에 시그모이드 게이트를 적용한 결과, 모델 성능과 훈련 안정성이 향상되며 'attention sink' 현상을 제거할 수 있었다.

    Zihan Qiu, Zekun Wang, Bo Zheng, Zeyu Huang, Kaiyue Wen

  8. #8TokenSkip: Controllable Chain-of-Thought Compression in LLMs

    TokenSkip는 CoT 내 불필요 토큰을 선택적으로 건너뛰며 추론 효율성을 향상시키는 LLM 압축 기법이다.

    Heming Xia, Yongqi Li, Chak Tou Leong, Wenjie Wang, Wenjie Li

  9. #9tinyBenchmarks: evaluating LLMs with fewer examples

    tinyBenchmarks는 대형 언어 모델(LLM) 평가를 100개 미만의 예시로 정확히 재현할 수 있도록 설계된 도구와 축소된 벤치마크 데이터셋을 제공한다.

    Felipe Maia Polo, Lucas Weber, Leshem Choshen, Yuekai Sun, Gongjun Xu

  10. #10DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads

    DuoAttention은 LLM의 장문맥 추론에서 메모리와 계산 효율성을 극대화하기 위해 Retrieval Heads와 Streaming Heads를 구분하는 새로운 인퍼런스 프레임워크이다.

    Guangxuan Xiao, Jiaming Tang, Jingwei Zuo, Junxian Guo, Shang Yang

  11. #301HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?

    HarnessDev는 LLM이 실행 인프라를 생성하고 개선하는 능력을 평가하는 벤치마크로, 생성 및 진화 단계에서 성능과 효율성을 측정한다.

    Yuhao Wu, Jingyuan Zhang, Jiajun Shi, Xinping Lei, Qingshui Gu

  12. #302Compile by Training: Turning Natural-Language Specifications into Local Neural Functions

    자연어 명세를 기반으로 로컬 신경망 함수를 생성하는 "Compile by Training" 방법을 제안한다.

    Yuntian Deng, Pengyu Nie, Stuart Shieber

  13. #303Aspire: Can Models Self-Evolve from Vague Goals?

    ASPIRE는 모델이 명확한 목표 없이 모호한 능력 목표로부터 스스로 진화할 수 있는 벤치마크를 제시한다.

    Yuhao Wu, Jingyuan Zhang, Jiajun Shi, Yuxuan Zhang, Xinping Lei

  14. #304Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments

    Terminal-Universe는 기존 에이전트 트레이잭토리에서 실행 가능한 환경을 재구성하고 새로운 작업을 합성하여 터미널 기반 코드 에이전트의 학습을 확장하는 프레임워크이다.

    Jie Wu, Zhenru Zhang, Beichen Zhang, Xuwu Wang, Yuhui Su

  15. #305LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes

    LLaDA-Image는 6B 규모의 DiT와 LLaDA2.0-Mini 기반 VLM을 결합한 오픈소스 이미지 생성 프레임워크로, 220M 샘플 중 98%가 실제 이미지이며 Qwen-Image-Bench에서 53.53 점을 달성했다.

    Chuyan Chen, Haoxing Chen, Kun Chen, Zhenglin Cheng, Long Cui

  16. #306Knowing When Not to Reuse: Conditional Experience Transfer in Autonomous LLM Post-Training

    BCIT는 자율적 사후 훈련에서 과거 경험의 조건부 재사용을 결정하는 문제를 해결하는 방법이다.

    Tingyun Li, Wenfeng Feng, Weiqing Li, Abudukelimu Wuerkaixi, Guohua Liu

  17. #307Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning

    Random Attention은 KV 캐시에서 무작위 추출을 통해 기존 선택 신호를 대체하면서도 성능을 유지하고 처리량을 32–43% 증가시킨다.

    Heng Wang, Jielin Qiu, Wenting Zhao, Cheng Qian, Liangwei Yang

  18. #308LatentPress: Context Compression Beyond Text and Vision

    LatentPress는 언어 모델이 텍스트 복원 없이 직접 읽을 수 있는 연속 메모리 토큰을 생성하여 대규모 컨텍스트를 압축하는 새로운 인터페이스를 제시한다.

    Zhengze Zhou, Hejian Sang

  19. #309Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLM

    Gated DeltaNet(GDN) 기반의 Qwen3.8-27B 모델을 NVFP4 W4A4로 전체 496개의 선형층을 4비트로 양자화하여 BF16 수준 성능을 달성한 연구.

    Sergii Kozyrev, Davyd Maiboroda

  20. #310Rethinking On-Policy Distillation of Large Language Models II: One Training Example

    단일 훈련 예시로도 대규모 언어 모델의 온-폴리시 디스틸레이션(OPD) 성능을 크게 회복할 수 있음을 밝힘.

    Zixuan Fu, Bingxiang He, Yuxin Zuo, Haohuan Huang, Jinqian Zhang

  21. #311Puffin-World: Scaling a Unified Multimodal Model with Native 3D World States

    Puffin-World는 물리, 기하, 외관을 통합한 3D 월드 생성 및 재구성을 위한 단일 프레임워크로, Omni-Camera와 Physics Propagation을 통해 물리적으로 일관되고 시각적으로 안정적인 월드 모델링을 실현한다.

    Kang Liao, Yihang Luo, Xiao-Ming Wu, Linyi Jin, Size Wu

  22. #312VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement

    VeriPhy는 생성된 동영상의 물리적 일관성을 체계적으로 검증하는 시스템으로, 149개 클립에서 304개 결함 중 228개를 감지했다.

    Wenzhuo Xu, Yuchen Zhu, Chongjian Ge, Xuan Shen, Jing Shi

  23. #313RoboTok: An Internet-Scale Data Engine for Human Demonstration Retrieval and Dexterous Manipulation Learning

    RoboTok은 인터넷 영상에서 인간 조작 동작을 추출해 로봇 정책 학습에 활용하는 대규모 데이터 엔진이다.

    Howard Qian, Yiting Chen, Yunfei Xie, Kejia Ren, Podshara Chanrungmaneekul

  24. #314SnapBench: Benchmarking Snap-and-Ask Multimodal Retrieval for Mobile Interactions

    SnapBench는 모바일 환경에서 사진과 질문을 결합한 다중모달 검색의 안정성을 평가하는 최초의 페어형 벤치마크이다.

    Zirong Chen, Fuda Ye, Kuan Zhang, Enjun Du, Junfu Pu

  25. #315Scal3R: Learning Efficient Multi-Relative Pose Query for Scalable Online 3D Reconstruction

    Scal3R은 KITTI 데이터셋에서 평균 ATE를 60% 이상 개선하며, 1% 미만의 파라미터로 온라인 3D 재구성을 안정적으로 수행하는 다중 참조 상대 자세 쿼리 프레임워크이다.

    Chin-Yang Lin, Yang-Che Sun, Cheng Sun, Fu-En Yang, Min-Hung Chen

  26. #316Editable Visual Design

    "Editable Visual Design"은 코드 생성과 시각 생성 모델을 결합해 편집 가능한 디자인을 실현하는 새로운 패러다임이다.

    Junyan Ye, Wei Liu, Dongzhi Jiang, Zichen Wen, HaoDong Li

  27. #317S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement?

    S3Gym은 LLM이 자가 테스트, 판단, 개선을 통해 성능을 향상시킬 수 있는지 평가하는 대화형 벤치마크이다.

    Jiajun Shi, Siyuan Tao, Yuhao Wu, Zexuan Wang, Jingyuan Zhang

  28. #318WHALE: A Simple Recipe for Joint Harness-Weight Optimization

    WHALE은 모델 가중치와 실행 가능한 헤이븐 코드를 번갈아 최적화함으로써 에이전트 성능을 향상시키는 모듈식 프레임워크이다.

    Haechan Kim, Yoonho Lee, Gisang Lee, Chelsea Finn, Kangwook Lee

  29. #319Beyond Visual Similarity: Entity-Aligned Retrieval for Knowledge-Based Visual Question Answering

    KBMR은 KB-VQA에서 CLIP 기반 검색의 한계를 극복한 MLLM 기반 검색기로, 최대 14.7%의 Recall@1 개선을 달성했다.

    Hangrui Xu, Zhengxian Wu, Yunyao Yu, Zhuohong Chen, Rui Cong

  30. #320The Missing Temporal Link: Temporal Context Routing for Script-Driven Audio-Video Generation

    TCR은 스크립트 기반 동영상 생성에서 비디오와 오디오의 타이밍을 스크립트와 정확히 맞추는 기술로, Shot Boundary MAE 96% 감소, Dialogue [email protected] 84.1% 달성.

    Yichen Liu, Quanwei Zhang, Haozhe Wang, Donghao Zhou, Xiaojie Li

인기 키워드

reinforcement-learning (331) diffusion-models (190) llm (190) llm-agents (160) video-generation (129) transformer (126) llm-evaluation (125) vision-language (112) vlm (109) long-context (99) large-language-models (94) code-generation (88) long-horizon (86) benchmark-evaluation (82) benchmarking (80) language-models (75) retrieval-augmented (73) flow-matching (68) world-models (68) foundation-models (67)