HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-08-06 featured 논문 30편

  1. #1AdaCLIP: Adapting CLIP with Hybrid Learnable Prompts for Zero-Shot Anomaly Detection

    AdaCLIP은 CLIP에 하이브리드 학습 가능한 프롬프트를 결합해 제로샷 이상 탐지 성능을 향상시키는 모델이다.

    Yunkang Cao, Jiangning Zhang, Luca Frittoli, Yuqi Cheng, Weiming Shen

  2. #2Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing

    Hunyuan3D-Buffalo 1.0은 87M 규모의 3D 다중모달 데이터셋을 기반으로 3D 이해, 생성, 편집을 통합한 첫 단일 아키텍처다.

  3. #3Material-Segmented Per-Pixel Emissivity Correction for Thermographic Anomaly Detection in Cultural Heritage Digital Twins

    문화유산 디지털 트윈의 열화상 이상 탐지에서 화소별 발사율 보정을 위한 훈련 없는 파이프라인을 제안한다.

  4. #4AgentStream: How Well Do Self-Evolving LLM Agents Perform Under Streaming Tasks?

    AgentStream은 다양한 스트리밍 시나리오에서 자기 진화하는 LLM 에이전트의 성능을 체계적으로 평가하는 통합 프레임워크이다.

  5. #5Unified Training of Universal Time Series Forecasting Transformers

    Moirai는 다양한 주파수와 다변량 시계열을 처리하는 대규모 유니버설 트랜스포머로, 27B개의 LOTSA 데이터셋에서 사전 학습되어 제로샷 성능이 기존 모델을 앞선다.

    Gerald Woo, Chenghao Liu, Akshat Kumar, Caiming Xiong, Silvio Savarese

  6. #6VideoCrafter2: Overcoming Data Limitations for High-Quality Video Diffusion Models

    VideoCrafter2는 저품질 데이터를 활용해 고품질 비디오 생성 모델을 학습하는 새로운 훈련 전략을 제안한다.

    Haoxin Chen, Yong Zhang, Xiaodong Cun, Menghan Xia, Xintao Wang

  7. #7LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding

    LongVideoBench는 1시간 길이의 영상-언어 복합 입력을 처리하는 대규모 다중 모달 모델을 평가하기 위한 새로운 벤치마크이다.

    Haoning Wu, Dongxu Li, Bei Chen, Junnan Li

  8. #8xLSTM: Extended Long Short-Term Memory

    xLSTM은 LSTM을 확장한 새로운 아키텍처로, Transformer와 경쟁할 수 있는 성능을 보인다.

    Maximilian Beck, Korbinian Poppel, M. Spanring, Andreas Auer, Oleksandra Prudnikova

  9. #9MobileNetV4 - Universal Models for the Mobile Ecosystem

    MobileNetV4는 다양한 모바일 하드웨어에서 Pareto 최적 성능을 보이는 모델로, UIB, Mobile MQA, NAS 개선, 디스틸레이션 기법 등을 통해 87% ImageNet-1K 정확도를 달성한다.

    Danfeng Qin, Chas Leichner, M. Delakis, M. Fornoni, Shixin Luo

  10. #10ORPO: Monolithic Preference Optimization without Reference Model

    ORPO는 참조 모델 없이 SFT 단계에서 직접 선호도를 최적화하는 새로운 알고리즘으로, 7B 모델로도 12.20%의 AlpacaEval 성능을 달성한다.

    Jiwoo Hong, Noah Lee, James Thorne

  11. #11An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models

    FastV는 LVLM에서 이미지 토큰의 불필요한 어텐션 계산을 제거하여 추론 비용을 45%까지 절감하는 플러그 앤 플레이 방식의 효율화 기법이다.

    Liang Chen, Haozhe Zhao, Tianyu Liu, Shuai Bai, Junyang Lin

  12. #12WildChat: 1M ChatGPT Interaction Logs in the Wild

    WildChat은 100만 건의 실제 사용자-ChatGPT 대화 기록을 담은 다국어, 다차례 대화 데이터셋으로, 사용자 행동 분석 및 대화 모델 튜닝에 활용 가능하다.

    Wenting Zhao, Xiang Ren, J. Hessel, Claire Cardie, Yejin Choi

  13. #13Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think

    REPA 정규화를 통해 디퓨전 트랜스포머의 생성 성능과 학습 효율성이 크게 향상된다.

    Sihyun Yu, Sangkyung Kwak, Huiwon Jang, Jongheon Jeong, Jonathan Huang

  14. #46Quo Vadis, World Modeling?

    세계 모델링을 에이전트 중심의 정보 전환 프록시로 확장하여 지속적 개선을 지원한다.

  15. #305GeoID-PINN: Identifiability-Aware Regional Epidemic Inference with Geographic Coupling

    GeoID-PINN은 지역 간 유행 구조를 식별하는 데 공간 정보를 통합한 물리 기반 신경망 모델이다.

  16. #306ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts

    ST-WAM은 시각 분포 변화에 강한 조작을 위한 의미-시간적 세계 행동 모델로, DINOv3와 VAE를 결합한 이중 공간 예측과 현재-앵커 인텐트 검색을 제안한다.

  17. #307Knowledge-Geometry Decoupling: Refreshable Pretrained Transfer for Streaming Recommendation

    KGD는 실시간 추천 시스템에서 지식과 기하학적 표현을 분리하여 4–12% 성능 향상과 1.75% GMV 증가를 달성한 프레임워크이다.

  18. #308MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations

    MerchantBench는 365일간 지속적인 온라인 판매 시뮬레이션을 통해 LLM 에이전트의 장기 일관성(Long-Term Coherence)을 평가하는 벤치마크이다.

  19. #309JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion

    JoyAI-Video-Edit는 실시간 오픈엔드 동영상 편집을 위한 16B 파라미터 자동회귀 확산 모델로, 30 FPS의 처리 속도를 달성한다.

  20. #310AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling

    AURORA-LM은 연속 잠재 공간에서 텍스트 생성을 위한 새로운 확산 언어 모델로, 블록 인과 트랜스포머와 쿼리 기반 인코더-디코더를 결합하여 높은 정확도를 달성한다.

  21. #311InfiniSplat: Implicit Gaussian Decoding for Large-Baseline Monocular View Synthesis

    InfiniSplat은 단일 이미지에서 표면 정렬된 3D 가우시안 표현을 생성하여 대규모 뷰포인트 변화에서도 안정적인 렌더링을 달성한다.

  22. #312Are the Financial Reasoning from LLMs Credible? A Real World Test over Long-Horizon Statements

    LLM이 금융 분석에서 진정한 구조적 추론을 수행하는지, FinIndices 벤치마크를 통해 실질적인 테스트를 진행한 연구.

  23. #313MiniWorld: Democratizing the Training of Video World Models from Scratch

    MiniWorld는 8-GPU 서버에서 단기간에 훈련 가능한, 스트리밍 비디오 월드 모델의 재현 가능한 기반 프레임워크이다.

  24. #314Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent

    Video-DeepResearch는 비디오 기반 멀티모달 에이전트의 새로운 훈련-평가 프레임워크로, 64.0% 정확도를 달성하며 기존 모델을 상회한다.

  25. #315PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning

    PCSD는 강화학습에서 토큰 수준의 지도 신뢰도를 지속적 일관성으로 추정하여 성능을 향상시키는 자기-디스틸레이션 방법이다.

  26. #316ARCHead: Activation-Metric Residual Correction for Large Language Model Output Heads

    ARCHead는 LLM의 출력 헤드를 압축하는 기술로, BF16 저장 공간을 3.7–3.9배 줄이며 1.007의 상대 퍼플렉시티를 달성한다.

  27. #317Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation

    STAMPlus는 다중 타겟 분할을 한 번의 비자동회귀 추론으로 수행하며, 성능과 추론 속도를 동시에 개선한 MLLM 기반 분할 모델이다.

  28. #318PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents

    PAST-Bench는 개인 에이전트의 경험 기반 자기 개선 능력을 평가하고 Hermes+를 통해 개선 경로를 진단하는 벤치마크와 개선 프레임워크를 제시한다.

  29. #319LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models

    LLaDA MoE v2는 23.5T 토큰으로 학습된 30B-A3B 확산 언어 모델로, Qwen3와 유사한 성능을 65% 적은 토큰으로 달성한다.

  30. #320OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models

    OmniPack은 Omni-LLM에서 구조적 압축과 세미나틱 정제를 결합한 훈련 없이도 높은 효율성과 성능을 유지하는 토큰 압축 프레임워크이다.

인기 키워드

reinforcement-learning (283) llm (161) diffusion-models (157) llm-agents (126) vlm (103) video-generation (102) transformer (101) llm-evaluation (97) vision-language (85) long-context (80) benchmark-evaluation (68) code-generation (67) long-horizon (64) large-language-models (61) language-models (60) foundation-models (58) retrieval-augmented (58) benchmarking (57) flow-matching (56) text-to-image (54)