HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-07-25 featured 논문 25편

  1. #1A Graph Neural Network approach to zero-shot Digital Twins

    제로샷 디지털 트윈을 위한 열역학 기반 그래프 신경망 프레임워크를 제안한다.

    Alicia Tierz, Icíar Alfaro, David González, Elías Cueto

  2. #2ReferTrack: Referring Then Tracking for Embodied Visual Tracking

    ReferTrack은 단일 전면 카메라 기반의 언어 지시 추적 문제를 해결하기 위해 언급 후 추적 방식을 도입한 VLA 모델로, EVT-Bench에서 최고 성능을 달성한다.

    Hanjing Ye, Tianle Zeng, Jiazhao Zhang, Shaoan Wang, Zibo Zhang

  3. #3TableVerse: A Large-scale Tabletop Dataset with Real-world Grounded Layouts for Generalizable Manipulation

    TableVerse는 10만 개의 실제 기반 테이블탑 환경과 조작 트레젝토리를 포함한 대규모 데이터셋을 생성하는 자동화된 Real2Sim 파이프라인을 제시한다.

    Boyuan Wang, Yue Zhang, Xutao Xue, Xueyu Song, Yu Sun

  4. #4FinanceComplexQA: Benchmarking Agentic Reasoning on Industrial-grade Financial Documents

    FinanceComplexQA는 1009개의 실제 금융 문서를 기반으로 2,026개의 깊은 연구 질문을 포함한 금융 문서 QA 벤치마크로, Agent-as-a-Judge 평가를 통해 정확도와 추론력을 평가한다.

    Xianfu Cheng, Shiwei Zhang, Jiyu Zhao, Jian Yang, Xinyuan Wang

  5. #6AREX: Towards a Recursively Self-Improving Agent for Deep Research

    AREX는 재귀적 자기 개선을 통해 깊은 연구 성능을 향상시키는 대형 언어 에이전트 시스템이다.

    Shuqi Lu, Chaofan Li, Kun Luo, Zhang Zhang, Hui Wang

  6. #7Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment

    Anchor-Align는 VLA 미세조정 시 사전 학습된 표현을 보존하고 언어-작동 정렬을 강화하여 실제 로봇 성능을 28%에서 54%까지 향상시킨다.

    Dwip Dalal, Shivansh Patel, Chahit Jain, Jeonghwan Kim, Utkarsh Mishra

  7. #9SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD

    Ascend NPU 기반으로 DeepSeek-V4 모델의 트릴리언-파라미터 포스트 트레이닝을 최적화한 SLAI T-Rex 프레임워크를 제시한다.

    Dongfang Li, Xiaodong Luo, Ruoyu Sun, Xuhui Chen, Linyuan Qiu

  8. #10Multi-Turn On-Policy Distillation with Prefix Replay

    ReOPD는 학습 비용을 4배 이상 절감하면서도 정확도를 유지하는 오프라인 멀티턴 온폴리시 디스틸레이션 방법이다.

    Baohao Liao, Hanze Dong, Christof Monz, Xinxing Xu, Li Dong

  9. #11DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations

    DocOps는 문서 조작 능력을 평가하는 검증 가능한 벤치마크 프레임워크이다.

    Jiazhen Jiang, Boxi Cao, Lingyong Yan, Yaojie Lu, Hongyu Lin

  10. #12K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs

    K12-KGraph는 중국 교과서 기반의 과정 지식 그래프로, 교육용 LLM의 커리큘럼 인지 능력을 평가하고 훈련하는 데 활용된다.

    Hao Liang, Qihan Lin, Zhaoyang Han, Xiaochen Ma, Zhen Hao Wong

  11. #13Visual Contrastive Self-Distillation

    VCSD는 시각 정보의 조건 변화를 활용한 간단한 온-포로피 시스드(VCSD)로, 외부 티처 없이 모델 성능을 향상시킨다.

    Yijun Liang, Yunjie Tian, Yijiang Li, Yuqi Jia, Furong Huang

  12. #14Recurrent Sinusoidal INRs for Efficient High-Fidelity Representation

    신경망의 파라미터 증가 없이 고주파 정보를 효과적으로 표현하는 반복 사인 활성화 기반 INR 구조를 제안한다.

    Hyunmin Cho, Jaejun Yoo, Kyong Hwan Jin

  13. #15Subliminal Clocks: Latent Time Modelling in Diffusion Language Models

    DLMs가 잔여 스트림 내에서 확산 단계 정보를 내재적으로 인코딩하고 이를 제어할 수 있음을 밝힘.

    Maximo Eduardo Rulli, Thomas Vaitses Fontanari, Simone Petruzzi, Federico Alvetreti, Giorgio Strano

  14. #16Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text

    ProVisE와 SpatialGen-Bench를 통해 이미지 생성 모델의 시각적 공간 인지 평가가 가능해졌다.

    Xu Wang, Kaixiang Yao, Miao Pan, Xiaohe Zhou, Xuanyu Liu

  15. #17Self Gradient Forcing: Native Long Video Extrapolation

    Self Gradient Forcing(SGF)는 자동 회귀 비디오 생성에서 역사적 컨텍스트의 학습을 강화하여 장시간 비디오 외삽을 향상시키는 2단계 훈련 전략이다.

    Junhao Zhuang, Shiyi Zhang, Yuxuan Bian, Yaowei Li, Yawen Luo

  16. #18Beyond Relevance-Centric Retrieval: Rubric-Oriented Document Set Selection and Ranking

    Rubric4Setwise는 문서 집합의 질을 다차원적으로 평가하고 이를 기반으로 최적의 문서 선택을 수행하여 생성 성능을 향상시키는 훈련 없이 작동하는 시스템이다.

    Kailin Jiang, Lei Liu, Jian Xi, Hui Xu, Junlin Liu

  17. #19An Exam for Active Observers

    ActiveVision 벤치마크를 통해 MLLMs가 활성 시각 관찰 능력을 갖추지 못함을 실증적으로 밝힘.

    Jiarui Zhang, Muzi Tao, Shangshang Wang, Ollie Liu, Xuezhe Ma

  18. #20NVIDIA-labs OO Agents: Native Python Object-Oriented Agents

    NVIDIA OO Agents(NOOA)는 AI 에이전트를 Python 객체로 표현하는 모델-비관련 프레임워크로, 개발자와 에이전트가 동일한 인터페이스를 공유하여 테스트 및 개선이 용이하다.

    Paul Furgale, Severin Klingler, James Nolan, Matt Staats, Gaia Di Lorenzo

  19. #21Color Pass-Through via Camera-Display Coupling

    스마트폰 카메라와 디스플레이를 통합한 Color Pass-Through 프레임워크를 제안하여 실제 장면의 색감을 정확히 재현한다.

    Ruikang Li, Molin Li, Jiarui Wu, Zhe Wei, Pengpeng Liu

  20. #22Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction

    Tencent WorkBuddy Bench는 코드, 웹, 오피스, 보안 4개 도메인에서 오염에 강한 코딩 에이전트 평가 벤치마크를 제공한다.

    Tencent WorkBuddy Bench Team, Siqi Cai, Shaopeng Chen, Xiang Fei, Yong Mao

  21. #23LLMs Get Lost in Evolving User Intent

    LLMs가 대화 중 사용자의 변화하는 의도를 효과적으로 추적하지 못한다는 문제를 밝혀낸 연구.

    Jihoon Tack, Philippe Laban, Jennifer Neville

  22. #24SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation

    SANA-Video 2.0은 5B 및 14B 규모의 하이브리드 어텐션 비디오 생성 모델로, 720p 영상 생성 시 3.2× 가속된 DiT 성능과 84.30의 VBench 점수를 달성한다.

    Junsong Chen, Jincheng Yu, Yitong Li, Shuchen Xue, Haozhe Liu

  23. #25Scaling Laws for Hypernetwork-Based Knowledge Injection in Large Language Models

    하이퍼네트워크 기반 지식 주입이 대규모 언어 모델에서 예측 가능한 스케일링 법칙과 우수한 OOD 일반화를 보인다.

    Nischay Dhankhar, Dos Baha, Abulhair Saparov

  24. #26Self-Supervised Learning of Structured Dynamics from Videos

    SDM은 동결된 이미지 백본 위에 구축된 구조화된 동영상 역학 모델로, 미래 특징 예측을 통해 카메라 운동과 객체 운동을 분리한다.

    Lukas Knobel, Andrew Zisserman, Yuki M. Asano

  25. #27Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization

    RIPO는 기하학적 불일치를 해결해 LLM RL에서 탐색 붕괴를 극복하고, AIME24에서 GRPO 대비 최대 60% 개선.

    Zhicheng Cai, Xinyuan Guo, Hanlin Wu, Mingxuan Wang, Wei-Ying Ma

인기 키워드

reinforcement-learning (257) llm (147) diffusion-models (136) llm-agents (116) vlm (101) video-generation (88) transformer (86) llm-evaluation (82) long-context (69) vision-language (64) code-generation (62) benchmark-evaluation (61) long-horizon (59) retrieval-augmented (55) foundation-models (52) text-to-image (52) flow-matching (50) large-language-models (50) benchmarking (49) language-models (47)