HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-08-27 featured 논문 30편

  1. #1World Model on Million-Length Video And Language With Blockwise RingAttention

    1M 토큰 길이의 언어 및 비디오-언어 모델을 구축하고, Blockwise RingAttention을 기반으로 확장성을 보장한 오픈소스 구현을 제시한다.

    Hao Liu, Wilson Yan, Matei Zaharia, Pieter Abbeel

  2. #2Towards a Densing Law for User Representation Learning at Billion-Scale Capacity

    유저 행동 데이터의 밀도 기반 토큰화 법칙(User Behavioral Densing Law)을 제안하고, ALGN이라는 적응형 토큰화 방법으로 대규모 유저 표현 학습 성능을 향상시킨다.

    Bin Dou, Junru Zhang, Zhaoyi Yuan, Wuliang Huang, Letian Gong

  3. #3BLOCK DIFFUSION: INTERPOLATING BETWEEN AU-TOREGRESSIVE AND DIFFUSION LANGUAGE MODELS

    BLOCK DIFFUSION은 확산 모델과 오토회귀 모델의 장점을 결합한 언어 모델로, 가변 길이 생성과 향상된 퍼플렉시티를 달성한다.

    Marianne Arriola, Aaron Gokaslan, Justin T. Chiu, Zhihan Yang, Zhi-Hong Qi

  4. #4DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving

    DiffusionDrive는 2단계의 truncated diffusion policy와 cascade decoder를 통해 실시간 자율주행 성능을 45 FPS, PDMS 88.1로 달성한 모델이다.

    Bencheng Liao, Shaoyu Chen, Haoran Yin, Bo Jiang, Cheng Wang

  5. #5EAGLE-2: Faster Inference of Language Models with Dynamic Draft Trees

    EAGLE-2는 EAGLE 기반으로, 컨텍스트에 따라 동적으로 드래프트 트리 구조를 조정하여 최대 5배의 속도 향상을 달성한 lossless 추론 가속 알고리즘이다.

    Yuhui Li, Fangyun Wei, Chao Zhang, Hongyang Zhang

  6. #6GRM: Large Gaussian Reconstruction Model for Efficient 3D Reconstruction and Generation

    GRM은 0.1초 이내에 3D 자산을 복원하는 3D Gaussian 기반의 대규모 생성 모델이다.

    Yinghao Xu, Zifan Shi, Wang Yifan, Hansheng Chen, Ceyuan Yang

  7. #7EMCAD: Efficient Multi-Scale Convolutional Attention Decoding for Medical Image Segmentation

    EMCAD는 의료 이미지 분할에서 성능과 계산 효율성을 동시에 최적화한 다중 스케일 컨볼루션 어텐션 디코더로, 12개 데이터셋에서 기존 방법 대비 79.4%의 파라미터 감소를 달성했다.

    M. Rahman, Mustafa Munir, R. Marculescu

  8. #8DNGaussian: Optimizing Sparse-View 3D Gaussian Radiance Fields with Global-Local Depth Normalization

    DNGaussian은 3D Gaussian Splatting 기반으로, 25× 훈련 시간 감소와 3000× 빠른 렌더링 속도를 달성한 저비용 높은 품질의 few-shot 뉴럴 라이트 필드 프레임워크이다.

    Jiahe Li, J. Zhang, Xiao Bai, Jin Zheng, Xin Ning

  9. #9The Effect of Sampling Temperature on Problem Solving in Large Language Models

    LLM에서 샘플링 템퍼러처가 문제 해결 성능에 통계적으로 유의미한 영향을 미치지 않는다는 것을 실증적으로 밝혔다.

    Matthew Renze, Erhan Guven

  10. #10Generative Flows on Discrete State-Spaces: Enabling Multimodal Flows with Applications to Protein Co-Design

    Discrete Flow Models(DFMs)를 제안하여, 연속과 이산 데이터를 결합한 다중모달 생성 모델을 구축하고 단백질 공설계에 적용한다.

    Andrew Campbell, Jason Yim, R. Barzilay, Tom Rainforth, T. Jaakkola

  11. #11Scaling Up to Excellence: Practicing Model Scaling for Photo-Realistic Image Restoration In the Wild

    SUPIR는 2000만 장의 고해상도 이미지와 텍스트 데이터를 기반으로, 텍스트 프롬프트와 생성 모델 스케일링을 활용한 초고품질 이미지 복원 모델이다.

    Fanghua Yu, Jinjin Gu, Zheyuan Li, Jinfan Hu, Xiangtao Kong

  12. #288GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture

    GigaBrain-0.7는 37,000시간 이상의 이질적 로봇 데이터로 사전 학습한 3시스템 아키텍처 기반의 VLA 모델로, 다양한 로봇 형태에서의 제로샷 성능과 작업 성공률을 대폭 향상시킨다.

    GigaBrain Team, Angen Ye, Axiang Sun, Can Jin, Chenxi Cheng

  13. #292EchoWM: Open and Enterable Omnimodal World Models

    EchoWM은 720p 영상, 환경음, 음악, 음성을 동시 생성하며, 1인칭 및 3인칭 시점의 연속 이동에 반응하는 옴니모달 월드 모델이다.

    Songchun Zhang, Yaowei Li, Junhao Zhuang, Weiyang Jin, Haoyu Wang

  14. #298One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows

    Thinkingbox는 상태 기반 비즈니스 워크플로우에서 에이전트의 신뢰성 평가를 위한 샌드박스와 벤치마크를 제시한다.

    Zhuochun Li, Youngmin Ko, Ali Keramati, Nicola Ferri, Susana Palmaz Lopez Pelaez

  15. #303DriftAD: Visually-Guided Text Drift for Few-Shot Industrial Anomaly Detection

    DriftAD는 CLIP 기반의 시각-언어 모델을 활용한 소량 샘플 산업 이상 탐지에서 정확도를 향상시키는 시각적으로 유도된 텍스트 드리프트 기법을 제안한다.

    Wenyang Liu, Tianyi Liu, Dongshuo Zhang, Kejun Wu, Adams Wai-Kin Kong

  16. #306Game2World Engine: Unlocking In-the-Wild Gameplay Videos for World Model Training

    게임 플레이 영상에서 UI를 제거해 월드 모델 학습 데이터를 생성하는 Game2World 엔진과 GameCleaner 모델을 제안한다.

    Wenxuan Shen, Dongna Jin, Dongping Chen

  17. #307MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World Tasks

    MobilePA-Bench는 모바일 환경에서 LLM 에이전트의 도구 사용 및 계획 능력을 종합적으로 평가하는 대규모 벤치마크이다.

    Yi Zhu, Xiongwei Wu, Qiyi Wang, Tingyu Qu, Jiajun Liu

  18. #308SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation

    SecOPD는 토큰 수준 피드백을 통해 적응형 프롬프트 주입 공격에 대응하는 방식으로 Qwen3.6-27B 모델의 공격 성공률을 94.0%에서 9.0%로 낮춘다.

    Yibo Peng, Long Lian, David Wagner, Sizhe Chen

  19. #309Industrial-Instruction: An End-to-End Framework for Building Instruction-Tuning and Benchmark Datasets from Industrial Technical Reports

    Industrial-Instruction은 산업 기술 보고서를 기반으로 QA 데이터셋과 생성 파이프라인을 제공하여 산업 벤치마크 및 훈련 데이터를 구축하는 실용적이고 재현 가능한 방법을 제시한다.

    Parsa Bakhtiari, Hassan Bashiri, Alireza Khalilipour, Masoud Nasiripour, Moharram Challenger

  20. #310Tomatoes, Potatoes, and Onions: Questioning the Need for Faces in Face Presentation Attack Detection

    토마토, 감자, 마늘을 사용한 무표현 얼굴 PAD 데이터셋 TPO를 통해 얼굴 정보 없이도 높은 성능의 PAD가 가능함을 실증.

    Guray Ozgur, Fadi Boutros, Naser Damer

  21. #311Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs

    OraRL은 비디오 MLLM의 강화학습 후처리를 효율화하고 확장 가능한 새로운 프레임워크로, 어노테이션을 직접 오라클로 활용하여 성능을 66.0~78.2%까지 향상시킨다.

    Yunheng Li, Guohong Mu, Hao Li, Shengsheng Qian, Dingwen Zhang

  22. #312WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report

    WeMM-Embedding은 2B, 4B, 9B 규모의 다중 모달 임베딩 모델로, MMEB-v2에서 80.6 점을 달성하며 실무 성능도 입증했다.

    Junjie Zhou, Ke Mei, Lei Li, Tianyi Wang, Fengyun Rao

  23. #313AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces

    AutoSaddler는 LLM 에이전트의 장기적 작업 성능을 자동 개선하는 하네스 최적화 프레임워크로, 실패 트레이스를 기반으로 지속적인 업데이트를 수행한다.

    Sungho Park, Wonjoong Kim, Rongyuan Tan, Jue Zhang, Wook-Shin Han

  24. #314On-Policy Self-Distillation in Diffusion Models

    DiffusionOPSD는 확산 모델의 포스트 트레이닝을 효율적으로 수행하기 위한 온-포로이 자기-디스틸레이션 프레임워크이다.

    Wei Zhou, Xiongwei Zhu, Lingdong Kong, Bo Chen, Lei Zhang

  25. #315Unlocking the Potential of Image Editing via Concept Scaling and Dense Supervision

    이미지 편집 모델의 성능을 향상시키기 위해 개념 세분화와 밀집된 지도 학습 전략을 제안하며, ConceptEdit-12M 데이터셋과 ConceptEdit-Bench 평가 도구를 제시한다.

    Long Cui, Xiaoqian Liu, Qi Qin, Yi Xin, Tao Lin

  26. #316AgentRoom: Concurrent Multi-Agent Coding in a CRDT-Backed Shared Workspace

    AgentRoom은 CRDT 기반 공유 워크스페이스에서 동시 다중 에이전트가 협업하는 실시간 프로토콜로, 파일 수준 클레임과 브로드캐스트를 통해 협업 실패를 억제한다.

    Seonglae Cho, Donghyun Lee

  27. #317Automata from Agent Traces: Failure and Next-Step Prediction

    LLM 에이전트의 실행 트레이스를 기반으로 생성된 FSM이 다음 단계 예측과 실패 예측 성능을 동시에 향상시킨다.

    Seonglae Cho, Franklin Cardenoso Fernandez, Umar Mohammed, Zekun Wu, Kleyton Da Costa

  28. #318The Mask Is Not the Model: Auditing Prefix Invariance in Attention, State-Space, and Hybrid Sequence Models

    전향 마스크 검사가 누설을 누락하는 이유를 규명하고, 새로운 인과성 검증 방법을 제시한다.

    Taebong Kim, Youngsik Hong, Minsik Kim, Sunyoung Choi, Jaewon Jang

  29. #319CyberFactory: Scaling Cyber Security Capabilities with Instances from the Wild

    CyberFactory는 오픈소스 보안 모델 OpenAegis를 훈련하기 위한 통합 프레임워크로, 58.1% Pass@1 성능을 기록했다.

    Jian Yang, Haau-Sing Li, Shawn Guo, Zixi Zhao, Yibo Tan

  30. #320Block3D: Efficient Text-to-3D Generation via Block-Wise Diffusion

    Block3D는 블록 단위 확산을 통해 텍스트-3D 생성 속도를 5.15배 향상시키며 기하학적 정확도를 유지한다.

    Bowen Cui, Weijie Wang, Zeyu Zhang, Yefei He, Mingda Lin

인기 키워드

reinforcement-learning (331) diffusion-models (190) llm (190) llm-agents (160) video-generation (129) transformer (126) llm-evaluation (125) vision-language (112) vlm (109) long-context (99) large-language-models (94) code-generation (88) long-horizon (86) benchmark-evaluation (82) benchmarking (80) language-models (75) retrieval-augmented (73) flow-matching (68) world-models (68) foundation-models (67)