HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-08-28 featured 논문 30편

  1. #1Real-IAD: A Real-World Multi-View Dataset for Benchmarking Versatile Industrial Anomaly Detection

    Real-IAD는 150K 장의 고해상도 이미지를 포함한 실세계 다각도 산업 이상 탐지 대규모 데이터셋이다.

    Chengjie Wang, Wenbing Zhu, Bin-Bin Gao, Zhenye Gan, Jianning Zhang

  2. #2WarpSAC: Towards the Pinnacle of Scalable Off-policy RL by Rethinking Exploration and Exploitation

    WarpSAC는 데이터 규모에 따라 안정화 기법을 조정함으로써, 확장 가능한 오프-정책 강화학습의 성능을 4.5%~23.1% 개선하는 알고리즘 패밀리이다.

    Zihao Wu, Hongyao Tang, Yi Ma, Huizhong Song, Pengyi Li

  3. #3When Does Frequency Decomposition Benefit Physics-Informed Neural Networks? A Preliminary Ablation Study

    주파수 분해가 PINN 성능에 언제 도움이 되는지 탐구한 실험적 연구.

    Shubham Rai

  4. #4Physics-Informed Error Field Learning: A Post-Training Optimization Framework for Physics-Informed Neural Networks

    PIEFL은 PINN의 후기 최적화 단계에서 오차 필드를 학습함으로써 계산 효율성을 향상시키는 새로운 프레임워크이다.

    Jiuyun Sun, Yong Zhang

  5. #5Lowering the Barrier to AI-Driven Inspection: A No-Code Workflow for Automated Structural Defect Detection

    YOLOEZ는 프로그래밍 없이 YOLO 기반 구조물 결함 탐지 모델을 개발할 수 있는 GUI 기반 오픈소스 플랫폼이다.

    Michael Holm, Tanner McElroy, Xinghang Zhang, Guang Lin

  6. #6AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents

    AgentHarm은 LLM 에이전트의 해로운 행동을 측정하기 위한 벤치마크로, 110개의 악의적 에이전트 작업과 440개의 증강 작업을 포함한다.

    Maksym Andriushchenko, Alexandra Souly, Mateusz Dziemian, Derek Duenas, Maxwell Lin

  7. #7Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach

    잠재 공간에서 반복적 추론을 통해 테스트 타임 계산을 확장하는 새로운 언어 모델 아키텍처를 제안한다.

    Jonas Geiping, Sean McLeish, Neel Jain, John Kirchenbauer, Siddharth Singh

  8. #8LLMLingua-2: Data Distillation for Efficient and Faithful Task-Agnostic Prompt Compression

    LLMLingua-2는 Transformer 기반의 데이터 디스틸레이션을 통해 2~5배 압축된 프롬프트를 생성하며, 기존 방법 대비 1.6~2.9배 빠른 처리 속도를 보인다.

    Zhuoshi Pan, Qianhui Wu, Huiqiang Jiang, Menglin Xia, Xufang Luo

  9. #9PointMamba: A Simple State Space Model for Point Cloud Analysis

    PointMamba는 3D 포인트 클라우드 분석에 Mamba 기반의 선형 복잡도 상태공간 모델을 도입한 간단하고 효율적인 접근법이다.

    Dingkang Liang, Xin Zhou, Wei Xu, Xingkui Zhu, Zhikang Zou

  10. #10Spotting LLMs With Binoculars: Zero-Shot Detection of Machine-Generated Text

    Binoculars는 두 개의 사전 학습된 LLM을 사용하여 제로샷 방식으로 90% 이상의 정확도로 기계 생성 텍스트를 탐지하는 새로운 방법이다.

    Abhimanyu Hans, Avi Schwarzschild, Valeriia Cherepanova, Hamid Kazemi, Aniruddha Saha

  11. #11ToolRL: Reward is All Tool Learning Needs

    ToolRL은 강화학습 기반의 보상 설계를 통해 LLM의 도구 사용 능력을 17% 향상시키는 체계적인 연구이다.

    Cheng Qian, Emre Can Acikgoz, Qi He, Hongru Wang, Xiusi Chen

  12. #12CRUXEval: A Benchmark for Code Reasoning, Understanding and Execution

    CRUXEval은 코드 추론, 이해, 실행 능력을 평가하는 800개의 간단한 파이썬 함수로 구성된 새로운 벤치마크이다.

    Alex Gu, Baptiste Rozière, Hugh Leather, Armando Solar-Lezama, Gabriel Synnaeve

  13. #13Parallelizing Linear Transformers with the Delta Rule over Sequence Length

    DeltaNet의 학습을 시퀀스 길이에 대해 병렬화한 하드웨어 효율 알고리즘을 제안하고, 1.3B 파라미터 모델로 실험하여 Mamba와 GLA를 상회하는 성능을 보인다.

    Songlin Yang, Bailin Wang, Yu Zhang, Yikang Shen, Yoon Kim

  14. #14Gen3C: 3D-Informed World-Consistent Video Generation with Precise Camera Control

    Gen3C는 3D 캐시를 기반으로 정밀 카메라 제어와 시간적 3D 일관성을 달성하는 비디오 생성 모델이다.

    Xuanchi Ren, Tianchang Shen, Jiahui Huang, Huan Ling, Yifan Lu

  15. #99D$^3$-MOPD: Adaptive Dynamic Domain ScheDuling for Efficient Multi-Teacher Distillation

    D$^3$-MOPD는 학습 속도에 따라 도메인 혼합을 동적으로 조정해 MOPD의 효율성을 3× 향상시키는 제로오버헤드 스케줄러이다.

    Zechen Sun, Zhiwei Zhang, Fei Zhao, Juntao Li, Mu Chuan

  16. #233GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture

    GigaBrain-0.7는 37,000시간 이상의 이질적 로봇 데이터로 사전 학습한 3시스템 아키텍처 기반의 VLA 모델로, 다양한 로봇 형태에서의 제로샷 성능과 작업 성공률을 대폭 향상시킨다.

    GigaBrain Team, Angen Ye, Axiang Sun, Can Jin, Chenxi Cheng

  17. #291Code World Model: Coding Agent as World Brain

    Code World Model은 코드 기반 월드 브레인과 비디오 모델을 결합하여 지속적이고 시각적으로 풍부한 세계 진화를 구현하는 프레임워크이다.

    Yiwen Chen, Guosheng Lin, Chi Zhang

  18. #304Game2World Engine: Unlocking In-the-Wild Gameplay Videos for World Model Training

    게임 플레이 영상에서 UI를 제거해 월드 모델 학습 데이터를 생성하는 Game2World 엔진과 GameCleaner 모델을 제안한다.

    Wenxuan Shen, Dongna Jin, Dongping Chen

  19. #305Multi-Modal Anomaly Detection: A Survey

    다중 모달 이상 탐지(MMAD)를 가정 기반 관점에서 체계적으로 정리하고, 기존 연구의 한계와 미래 방향을 제시한다.

    Xudong Mou, Zexin Wu, Chuan Luo, Shiru Chen, Xudong Liu

  20. #310SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation

    SecOPD는 토큰 수준 피드백을 통해 적응형 프롬프트 주입 공격에 대응하는 방식으로 Qwen3.6-27B 모델의 공격 성공률을 94.0%에서 9.0%로 낮춘다.

    Yibo Peng, Long Lian, David Wagner, Sizhe Chen

  21. #311VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction

    VoiceMem은 실시간 음성 대화 시스템에 정보와 감정 메모리를 결합한 스트리밍 듀얼 브레인 메모리 프레임워크이다.

    Zhifei Xie, Jiaqi Lang, Ze An, Yifan Zhao, Dongchao Yang

  22. #312VGI-BENCH: Probing Visual Intelligence in Video Generation Models

    VGI-Bench는 영상 생성 모델의 시각적 추론 능력을 평가하기 위한 새로운 벤치마크로, Seedance 2.0 모델이 51.0% 성능을 기록하는 등 현재 모델들의 한계를 드러낸다.

    Xuan He, Cong Wei, Yuhao Cheng, Linrui Ma, Yuxuan Zhang

  23. #313FrontierChallenge: Evaluating Scientific Workflow Completion

    FrontierChallenge는 과학적 워크플로우 완료 능력을 평가하는 다분야 벤치마크로, 97개 과제에서 최고 성능 모델의 Pass Rate가 20.6%에 불과한 것으로 나타났다.

    Liangcai Su, Zhaopeng Feng, Zhuo Chen, Zhen Zhang, Xiang Lin

  24. #314Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs

    OraRL은 비디오 MLLM의 강화학습 후처리를 효율화하고 확장 가능한 새로운 프레임워크로, 어노테이션을 직접 오라클로 활용하여 성능을 66.0~78.2%까지 향상시킨다.

    Yunheng Li, Guohong Mu, Hao Li, Shengsheng Qian, Dingwen Zhang

  25. #315StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models

    StreamPI는 기존 단일 프레임 VLA 모델에 시간 정보를 추가하면서 추가 파라미터 없이 실시간 추론을 가능하게 하는 스트리밍 멀티모달 시간 모델링 프레임워크이다.

    Zhe Liu, Jinghua Hou, Yuxiang Lu, Zhenya Yang, Xianzhe Fan

  26. #316AgentRoom: Concurrent Multi-Agent Coding in a CRDT-Backed Shared Workspace

    AgentRoom은 CRDT 기반 공유 워크스페이스에서 동시 다중 에이전트가 협업하는 실시간 프로토콜로, 파일 수준 클레임과 브로드캐스트를 통해 협업 실패를 억제한다.

    Seonglae Cho, Donghyun Lee

  27. #317WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report

    WeMM-Embedding은 2B, 4B, 9B 규모의 다중 모달 임베딩 모델로, MMEB-v2에서 80.6 점을 달성하며 실무 성능도 입증했다.

    Junjie Zhou, Ke Mei, Lei Li, Tianyi Wang, Fengyun Rao

  28. #318JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution

    JIT-Agent는 임의의 LLM에 실시간으로 최적화된 agent harness를 생성하여 성능을 대폭 향상시킨다.

    Guibin Zhang, Leo Lu, Fangzhou Xie, Kang Zhu, Junhao Wang

  29. #319Automata from Agent Traces: Failure and Next-Step Prediction

    LLM 에이전트의 실행 트레이스를 기반으로 생성된 FSM이 다음 단계 예측과 실패 예측 성능을 동시에 향상시킨다.

    Seonglae Cho, Franklin Cardenoso Fernandez, Umar Mohammed, Zekun Wu, Kleyton Da Costa

  30. #320VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning

    VBVR-Pro는 시각 생성을 기반으로 한 네이티브 시각 추론을 학습 가능하고 검증 가능하게 구현한 종합적인 테스트베드이다.

    Junxiang Xu, Ruisi Wang, Fanyi Pu, Maijunxian Wang, Ran Ji

인기 키워드

reinforcement-learning (331) diffusion-models (190) llm (190) llm-agents (160) video-generation (129) transformer (126) llm-evaluation (125) vision-language (112) vlm (109) long-context (99) large-language-models (94) code-generation (88) long-horizon (86) benchmark-evaluation (82) benchmarking (80) language-models (75) retrieval-augmented (73) flow-matching (68) world-models (68) foundation-models (67)