HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-07-20 featured 논문 25편

  1. #12SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment

    SUFLECA는 674K 이미지로 학습한 기하학적 특징을 기반으로 CAD 모델과 RGB 이미지를 정렬하는 제로샷 방법이다.

    Saad Ejaz, Miguel Fernandez-Cortizas, Javier Civera, Holger Voos, Jose Luis Sanchez-Lopez

  2. #23RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination

    RxBrain은 언어-시각적 추론과 상상력을 결합한 임바디드 인지 기초 모델이다.

    Haotian Liang, Mingkang Chen, Yufei Huang, Yuchun Guo, Xiaomeng Zhu

  3. #24Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations

    On-policy distillation(OPD)의 역할, 병리, 규제를 체계적으로 분석하고, 신뢰성 있는 신호로 학습 안정성을 향상시킨다.

    Rui Wang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang

  4. #26Video = World + Event Stream

    Wan-Streamer v0.3은 영상 생성을 "세계 + 이벤트 스트림"으로 분해하여 실시간 다중모달 상호작용을 구현한 모델이다.

    Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng

  5. #28Discrete Diffusion Models: A Unified Framework from Tokenization to Generation

    이 연구는 토큰화를 중심으로 하는 이산 확장 모델의 통합적 프레임워크를 제시한다.

    Ye Yuan, Weien Li, Rui Song, Zeyu Li, Haochen Liu

  6. #29Tracing Agentic Failure from the Flow of Success

    OAT는 성공 트래젝토리만으로 학습하여 실패 트래젝토리의 오류 단계를 탐지하는 무감독 실패 분석 모델로, GPT-5 대비 200–5000배 빠르고 F1 점수 +20% 개선.

    Samuel Yeh, Yiwen Zhu, Shaleen Deep, Sharon Li

  7. #30DeepLoop: Depth Scaling for Looped Transformers

    DeepLoop는 반복된 파라미터 재사용을 고려한 잔차 스케일링 규칙을 제안하여 Looped Transformer의 안정적 깊이 확장을 가능하게 한다.

    Shuzhen Li, Yifan Zhang, Jiacheng Guo, Quanquan Gu, Mengdi Wang

  8. #31WanSong v1.0 Technical Report

    WanSong v1.0은 5분 길이의 다국어 고품질 음악을 단일 스테이지 확산 모델로 생성하며, 보컬과 배경음악을 분리 출력하는 음악 생성 기반 모델이다.

    Binghui Chen, Pandeng Li, Yu Liu, Jingren Zhou

  9. #32MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators

    MeanFlowNFT는 MeanFlow 생성 모델에 최초로 적용된 forward-process RL 프레임워크로, 평균 속도 기반 샘플링 효율성을 유지하면서 생성 품질을 향상시킨다.

    Yushi Huang, Xiangxin Zhou, Jun Zhang, Liefeng Bo, Tianyu Pang

  10. #33PalmClaw: A Native On-Device Agent Framework for Mobile Phones

    PalmClaw는 모바일 기기에서 직접 실행되는 오픈소스 에이전트 프레임워크로, 11.5%의 작업 성공률 향상과 94.9%의 완료 시간 감소를 기록했다.

    Hongru Cai, Yongqi Li, Ran Wei, Wenjie Li

  11. #34Vinci2: Providing Proactive Assistance in Continuous Egocentric Videos

    Vinci2는 지속적인 1인칭 비디오에서 사용자의 히스토리와 현재 활동을 고려해 적절한 시점에 개입하는 프로액티브 보조 시스템으로, EgoMemo와 EgoServe를 제시한다.

    Gong Sitong, Tianyu Yan, Caixin Kang, Bo Zheng, Xiang Ruan

  12. #35Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel

    12B 규모의 언어 모델에 검증된 지식을 바이트 단위로 이식하여 정확도를 80.0%에서 93.3%로 높이고, 추론 비용을 6,574배 절감하는 기술을 제시한다.

    Sietse Schelpe

  13. #36From Noisy Traces to Root Causes: Structural Trajectory Analysis and Causal Extraction for Agent Optimization

    STRACE는 실행 추적의 잡음을 줄이고 근본 원인을 추출하여 에이전트 최적화 성능을 1.4배 향상시키는 구조적 분석 프레임워크이다.

    Ying Chang, Jiahang Xu, Xuan Feng, Chenyuan Yang, Peng Cheng

  14. #37VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance

    VIABench는 시각 장애인의 일상 지원을 위한 MLLM 평가를 위한 첫 번째 1인칭 영상 벤치마크로, Proactive Reminder, VQA, Vision-Guided Interaction 3가지 핵심 작업을 정의하고 있다.

    Yunfeng Liu, Yuandong Yang, Jiarui Han, Zhenpeng Huang, Yuqing Tang

  15. #38Length Penalties Make Chain-of-Thought Less Monitorable

    길이 제재가 사고 과정을 줄이면서 모델의 답변 영향을 감추는 경향이 있다.

    Bryce Little

  16. #39Self in Space: Benchmarking Self-Awareness and Spatial Cognition in UAV Embodied Intelligence

    SIS-Bench는 UAV 시나리오에서 공간 인지와 자기 인식을 평가하는 새로운 벤치마크로, MLLM의 자기 인식 부족과 인지 계층별 성능 저하를 밝혀내며, motion-aware 표현이 이를 개선함을 보인다.

    Zhishan Zou, Guoyan Sun, Zhiwei Wei, Jiancheng Pan, Yujie Li

  17. #40Token Time Continuous Diffusion for Language Modeling

    TTCD는 토큰별 시간 개념을 도입한 연속 확산 언어 모델로, 빠른 속도에서도 생성 성능을 유지한다.

    Parikshit Bansal, Sujay Sanghavi

  18. #41AsySplat: Efficient Asymmetric 3D Gaussian Splatting for Long-Sequence Scene Modeling

    AsySplat은 3D Gaussian Splatting에서 계산 중복을 줄이기 위해 기하학과 외관 모델링을 분리한 비대칭 구조를 제안하여, 800× 가속과 30% 파라미터 감소를 달성한다.

    Yingji Zhong, Dave Zhenyu Chen, Fuzhao Ou, Youyu Chen, Zhihao Li

  19. #42Partition, Prompt, Aggregate: Statistical Self-Consistency in Language Models

    LLM이 통계적 자기일관성을 얼마나 잘 따르는지 평가하는 연구.

    Patrik Wolf, Thomas Kleine Buening, Andreas Krause, Celestine Mendler-Dünner

  20. #43Rethinking the Evaluation of Harness Evolution for Agents

    LLM 에이전트의 하버스 진화 평가 프로토콜을 재검토하고, 기존 평가 방식의 한계를 드러냄.

    Yike Wang, Huaisheng Zhu, Zhengyu Hu, Yige Yuan, Zhengyu Chen

  21. #44Generative Compilation: On-the-Fly Compiler Feedback as AI Generates Code

    Rust 언어에서 생성 중인 코드에 실시간 컴파일러 피드백을 제공하는 새로운 방법, Generative Compilation을 제안한다.

    Niels Mündler-Sasahara, Hristo Venev, Dawn Song, Martin Vechev, Jingxuan He

  22. #45GRASP: GRanularity-Aware Search Policy for Agentic RAG

    GRASP는 강화학습 기반의 다단계 추론을 위한 적응형 검색 정책으로, 의미 검색, 키워드 검색, 단락 읽기 동작을 조율한다.

    Varun Gandhi, Jaewook Lee, Shantanu Todmal, Franck Dernoncourt, Ryan Rossi

  23. #46From Controlled to the Wild: Evaluation of Pentesting Agents for the Real-World

    [AI 보안 / 펜테스팅 평가] AI 펜테스팅 에이전트를 실제 환경의 "검증된 취약점 발견" 기준으로 평가하는 실용적 평가 프로토콜과 EthiBench를 제안합니다.

    Pedro Conde, Henrique Branquinho, Valerio Mazzone, Bruno Mendes, André Baptista

  24. #47Chat2Scenic: An Iterative RAG-Based Framework for Scenario Generation in Autonomous Driving

    Chat2Scenic은 자율주행 시스템 시나리오 생성을 위한 반복적 RAG 기반 프레임워크로, 76.42%의 컴파일 성공률을 달성했다.

    Yuan Gao, Wenting Miao, Mattia Piccinini, Haoyu Wang, Qunying Song

  25. #48AffectFlow-DINO: Uncertainty-Aware Multi-Task Affect Estimation via Conditional Rectified Flow

    AffectFlow-DINO는 조건부 정류 흐름(conditional rectified flow)을 활용해 얼굴 행동의 불확실성을 모델링하는 다중 태스크 감정 추정 시스템이다.

    Salah Eddine Bekhouche, Abdellah Zakaria Sellam, Fadi Dornaika, Abdenour Hadid

인기 키워드

reinforcement-learning (246) llm (146) diffusion-models (132) llm-agents (113) vlm (100) transformer (84) llm-evaluation (82) video-generation (82) long-context (68) vision-language (60) benchmark-evaluation (58) code-generation (57) long-horizon (57) retrieval-augmented (55) foundation-models (51) text-to-image (51) flow-matching (50) large-language-models (47) language-models (46) benchmarking (45)