HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-09-15 featured 논문 30편

  1. #1End-to-End Driving with Online Trajectory Evaluation via BEV World Model

    WoTE는 BEV 월드 모델을 활용해 미래 상태를 예측하는 실시간 운전 경로 평가 프레임워크로, NAVSIM 및 Bench2Drive 벤치마크에서 최고 성능을 달성했다.

    Yingyan Li, Yu-Quan Wang, Yang Liu, Jiawei He, Lue Fan

  2. #2ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning

    ThinkAct는 강화 학습 기반의 시각 잠재 계획을 통해 시각-언어-행동(VLA) 추론을 구현하는 이중 시스템 프레임워크이다.

    Chi-Pin Huang, Yueh-Hua Wu, Min-Hung Chen, Y. Wang, Fu-En Yang

  3. #3Implicit Style-Content Separation using B-LoRA

    B-LoRA를 통해 단일 이미지에서 스타일과 콘텐츠를 암시적으로 분리하여 다양한 이미지 스타일화 작업을 가능하게 한다.

    Yarden Frenkel, Yael Vinker, Ariel Shamir, D. Cohen-Or

  4. #6Logit Standardization in Knowledge Distillation

    로짓 표준화를 통해 지식 증류 성능을 향상시키는 새로운 전처리 방법을 제안한다.

    Shangquan Sun, Wenqi Ren, Jingzhi Li, Rui Wang, Xiaochun Cao

  5. #7AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning

    AReaL은 대규모 언어 모델의 강화 학습을 위한 비동기식 시스템으로, 동기식 시스템 대비 최대 2.77×의 학습 가속을 달성한다.

    Wei Fu, Jiaxuan Gao, Xu Shen, Chen Zhu, Zhiyu Mei

  6. #8Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding

    Video-XL은 VST 모듈을 활용해 16× 압축에서도 높은 정확도를 유지하는 장시간 동영상 이해 모델이다.

    Yan Shu, Peitian Zhang, Zheng Liu, Minghao Qin, Junjie Zhou

  7. #9SplattingAvatar: Realistic Real-Time Human Avatars With Mesh-Embedded Gaussian Splatting

    SplattingAvatar는 삼각형 메시에 임베딩된 가우시안 스플래팅을 활용해 300 FPS 이상의 실시간 렌더링이 가능한 고해상도 인간 아바타를 제시한다.

    Zhijing Shao, Zhaolong Wang, Zhuang Li, Duotun Wang, Xiangru Lin

  8. #10OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLM

    OmniMedVQA는 73개 의료 데이터셋을 기반으로 구성된 대규모 의료 VQA 벤치마크로, LVLM의 의료 분야 성능 평가에 기여한다.

    Yutao Hu, Tian-Xin Li, Quanfeng Lu, Wenqi Shao, Junjun He

  9. #11StreamingT2V: Consistent, Dynamic, and Extendable Long Video Generation from Text

    StreamingT2V는 CAM과 APM을 통해 2분 이상의 일관성 있는 장시간 동영상 생성을 가능하게 하는 텍스트-투-비디오 확산 모델이다.

    Roberto Henschel, L. Khachatryan, Daniil Hayrapetyan, Hayk Poghosyan, Vahram Tadevosyan

  10. #12The Unreasonable Ineffectiveness of the Deeper Layers

    LLM의 더 깊은 레이어가 지식 저장에 기여하지 않는다는 사실을 레이어 프루닝과 QLoRA를 통해 입증.

    Andrey Gromov, Kushal Tirumala, Hassan Shapourian, Paolo Glorioso, Daniel A. Roberts

  11. #298Physics-Informed Conformal Prediction: Embedding PDE Consistency into Distribution-Free Uncertainty Quantification for Neural Operators

    물리학 정보를 통합한 확률적 예측 구조인 PI-CP를 제안하여 PDE 해석 모델의 불확실성을 분포와 무관하게 정량화한다.

  12. #309SNAP3D: Physically Grounded 3D Parts for Assembly from a Single Image

  13. #310DataFlex-RL: An Evaluation Platform for RLVR Data Policies

  14. #311Feyospace-v1: How the Cyber Mercury Seven Trained Frontier Cyber Models

  15. #312Benchmark Radar: A Living Database and Search Engine for AI Benchmarks and Evaluation

  16. #313Breaking the Vision-Action Shortcut: Latent Interface Training for Generalizable Robotics Foundation Models

  17. #316Robust Prototypical Networks for Few-Shot Sensor Fault Diagnosis

  18. #317Fundamental Dynamical Units for Physics-Informed Structural Inference from Perturbation Time-Series in Networked Systems

    FDU(Fundamental Dynamical Units)를 도입하여 네트워크 동역학 시스템의 구조를 물리 기반 신경 ODE와 결합한 인과 추론 프레임워크를 제안한다.

  19. #318Spectral Consistency-Guided Multiview Point Cloud Registration for Low-Overlap Scenes

  20. #319SAS: Simple Attention Sparsification via End-to-End Optimization of Context Ranking

  21. #326Beyond Solver Verdicts: Generative Reward Models for Autoformalization

    GenV+HN은 Z3 기반 오프라인 검증 정보를 활용해 참조-동등성을 검증하는 생성적 검증 모델로, 0.961 AUROC 성능을 달성하고 11.3포인트의 정확도 향상을 유도한다.

  22. #328COBRA-Skills: Contextual Bandit-Guided Evolution for Agent Skill Optimization

  23. #329StepAudio 3 Gen Technical Report

  24. #333Building Multilingual Bridges: Data Mixing as the Pillar of Generalization for In-Language Reasoning

    3.35B 규모의 Tiny Aya L2-Thinker 모델을 통해 60개 언어에서 93% 이상의 L2 추론률을 달성하며, 다국어 추론 성능을 확장하는 데이터 중심 접근법을 제시한다.

  25. #334Generative Late-Interaction Embeddings For Visual Document Retrieval

    GLIE는 저장 공간 효율성을 유지하면서도 정확도를 보존하는 새로운 후처리 기반의 시각 문서 검색 방법이다.

  26. #335UniH^3: Unifying Hierarchical Homogeneity and Heterogeneity for All-in-One Medical Image Restoration

    UniH3는 의료 이미지 복원의 다중 태스크와 모달리티를 통합하는 새로운 프레임워크로, 계층적 동질성과 이질성을 동시에 모델링한다.

  27. #336CARDEA: Auditable Reasoning Grounded in Spatial Evidence for End-to-End Coronary Angiography Interpretation

    CARDEA는 강력한 시각-언어 모델과 Chain-of-Box 추론을 결합해 치료 결정을 지지하는 체계적 CAG 해석 파이프라인을 제공한다.

  28. #337PLC-DPO: Posterior Label Correction in Noisy and Ambiguous Preference Optimization

  29. #338Adaptive Bridge: A Proxy-Based Decoupling Layer for Mitigating DDS Backpressure in ROS 2

    Adaptive Bridge는 ROS 2의 DDS 백프레셔 문제를 해결하기 위해 주요 구독자를 분리하는 프록시 기반 레이어를 제안한다.

  30. #339ActReview: Rebuttal-Guided Training Data and Rubric Rewards for Actionable Peer Review Generation

    ActReview는 저자 반박을 활용한 행동 가능한 피어 리뷰 생성을 위한 후-트레이닝 프레임워크로, 진단 생성과 수정 제안 생성을 구조화하여 리뷰 품질을 향상시킨다.

인기 키워드

reinforcement-learning (355) diffusion-models (204) llm (200) llm-agents (167) llm-evaluation (139) video-generation (138) transformer (133) vision-language (127) vlm (109) long-context (107) large-language-models (102) code-generation (98) long-horizon (91) benchmark-evaluation (90) benchmarking (87) language-models (82) retrieval-augmented (78) foundation-models (73) flow-matching (72) world-models (72)