HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-07-26 featured 논문 25편

  1. #1ReferTrack: Referring Then Tracking for Embodied Visual Tracking

    ReferTrack은 단일 전면 카메라 기반의 언어 지시 추적 문제를 해결하기 위해 언급 후 추적 방식을 도입한 VLA 모델로, EVT-Bench에서 최고 성능을 달성한다.

    Hanjing Ye, Tianle Zeng, Jiazhao Zhang, Shaoan Wang, Zibo Zhang

  2. #2FinanceComplexQA: Benchmarking Agentic Reasoning on Industrial-grade Financial Documents

    FinanceComplexQA는 1009개의 실제 금융 문서를 기반으로 2,026개의 깊은 연구 질문을 포함한 금융 문서 QA 벤치마크로, Agent-as-a-Judge 평가를 통해 정확도와 추론력을 평가한다.

    Xianfu Cheng, Shiwei Zhang, Jiyu Zhao, Jian Yang, Xinyuan Wang

  3. #3TableVerse: A Large-scale Tabletop Dataset with Real-world Grounded Layouts for Generalizable Manipulation

    TableVerse는 10만 개의 실제 기반 테이블탑 환경과 조작 트레젝토리를 포함한 대규모 데이터셋을 생성하는 자동화된 Real2Sim 파이프라인을 제시한다.

    Boyuan Wang, Yue Zhang, Xutao Xue, Xueyu Song, Yu Sun

  4. #5AREX: Towards a Recursively Self-Improving Agent for Deep Research

    AREX는 재귀적 자기 개선을 통해 깊은 연구 성능을 향상시키는 대형 언어 에이전트 시스템이다.

    Shuqi Lu, Chaofan Li, Kun Luo, Zhang Zhang, Hui Wang

  5. #8K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs

    K12-KGraph는 중국 교과서 기반의 과정 지식 그래프로, 교육용 LLM의 커리큘럼 인지 능력을 평가하고 훈련하는 데 활용된다.

    Hao Liang, Qihan Lin, Zhaoyang Han, Xiaochen Ma, Zhen Hao Wong

  6. #9Multi-Turn On-Policy Distillation with Prefix Replay

    ReOPD는 학습 비용을 4배 이상 절감하면서도 정확도를 유지하는 오프라인 멀티턴 온폴리시 디스틸레이션 방법이다.

    Baohao Liao, Hanze Dong, Christof Monz, Xinxing Xu, Li Dong

  7. #11Visual Contrastive Self-Distillation

    VCSD는 시각 정보의 조건 변화를 활용한 간단한 온-포로피 시스드(VCSD)로, 외부 티처 없이 모델 성능을 향상시킨다.

    Yijun Liang, Yunjie Tian, Yijiang Li, Yuqi Jia, Furong Huang

  8. #12Recurrent Sinusoidal INRs for Efficient High-Fidelity Representation

    신경망의 파라미터 증가 없이 고주파 정보를 효과적으로 표현하는 반복 사인 활성화 기반 INR 구조를 제안한다.

    Hyunmin Cho, Jaejun Yoo, Kyong Hwan Jin

  9. #14Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text

    ProVisE와 SpatialGen-Bench를 통해 이미지 생성 모델의 시각적 공간 인지 평가가 가능해졌다.

    Xu Wang, Kaixiang Yao, Miao Pan, Xiaohe Zhou, Xuanyu Liu

  10. #15OpenForgeRL: Train Harness-native Agents in Any Environment

    OpenForgeRL은 다양한 환경에서 하네스 기반 에이전트를 end-to-end로 학습할 수 있는 오픈소스 프레임워크로, 31.7 pass³ 등 여러 벤치마크에서 기존 모델을 능가한다.

    Xiao Yu, Baolin Peng, Ruize Xu, Hao Zou, Qianhui Wu

  11. #19NVIDIA-labs OO Agents: Native Python Object-Oriented Agents

    NVIDIA OO Agents(NOOA)는 AI 에이전트를 Python 객체로 표현하는 모델-비관련 프레임워크로, 개발자와 에이전트가 동일한 인터페이스를 공유하여 테스트 및 개선이 용이하다.

    Paul Furgale, Severin Klingler, James Nolan, Matt Staats, Gaia Di Lorenzo

  12. #20Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction

    Tencent WorkBuddy Bench는 코드, 웹, 오피스, 보안 4개 도메인에서 오염에 강한 코딩 에이전트 평가 벤치마크를 제공한다.

    Tencent WorkBuddy Bench Team, Siqi Cai, Shaopeng Chen, Xiang Fei, Yong Mao

  13. #21SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation

    SANA-Video 2.0은 5B 및 14B 규모의 하이브리드 어텐션 비디오 생성 모델로, 720p 영상 생성 시 3.2× 가속된 DiT 성능과 84.30의 VBench 점수를 달성한다.

    Junsong Chen, Jincheng Yu, Yitong Li, Shuchen Xue, Haozhe Liu

  14. #22Color Pass-Through via Camera-Display Coupling

    스마트폰 카메라와 디스플레이를 통합한 Color Pass-Through 프레임워크를 제안하여 실제 장면의 색감을 정확히 재현한다.

    Ruikang Li, Molin Li, Jiarui Wu, Zhe Wei, Pengpeng Liu

  15. #23LLMs Get Lost in Evolving User Intent

    LLMs가 대화 중 사용자의 변화하는 의도를 효과적으로 추적하지 못한다는 문제를 밝혀낸 연구.

    Jihoon Tack, Philippe Laban, Jennifer Neville

  16. #24Self-Supervised Learning of Structured Dynamics from Videos

    SDM은 동결된 이미지 백본 위에 구축된 구조화된 동영상 역학 모델로, 미래 특징 예측을 통해 카메라 운동과 객체 운동을 분리한다.

    Lukas Knobel, Andrew Zisserman, Yuki M. Asano

  17. #26Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization

    RIPO는 기하학적 불일치를 해결해 LLM RL에서 탐색 붕괴를 극복하고, AIME24에서 GRPO 대비 최대 60% 개선.

    Zhicheng Cai, Xinyuan Guo, Hanlin Wu, Mingxuan Wang, Wei-Ying Ma

  18. #27Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers

    WorldWeaver는 다중 에이전트 환경에서 일관된 세계 상태를 유지하는 스트리밍 비디오 확산 모델로, 세계 상태 레지스터와 Mixture-of-Transformers(MoT) 구조를 도입한다.

    Sicheng Mo, Yuheng Li, Ziyang Leng, Krishna Kumar Singh, Bolei Zhou

  19. #28Sample-Efficient Learning from Agent Experience

    경험 기반 학습에서 샘플 효율성을 향상시키기 위한 Experience Distillation 방법을 제안한다.

    Chenhui Gou, Haoqin Tu, Yunhao Fang, Jianfei Cai, Hamid Rezatofighi

  20. #29AutoIndex: Learning Representation Programs for Retrieval

    AutoIndex는 BM25 기반 검색 성능을 향상시키기 위해 문서 표현 프로그램을 학습하는 프레임워크로, CRUMB 벤치마크에서 평균 +8.4%의 Recall@100 개선을 달성했다.

    Sam O'Nuallain, Nithya Rajkumar, Ramya Narayanasamy, Hanna Jiang, Shreyas Chaudhari

  21. #30Preference Tuning as Spectral Update Reorganization

    RLHF와 선호도 최적화를 스펙트럼 구조로 분석하여 학습된 업데이트의 재구성 가능성을 밝혀낸 연구.

    Peiyan Zhang, Haibo Jin, Liying Kang, Haohan Wang

  22. #31Robostral Navigate

    Robostral Navigate는 단일 RGB 카메라만 사용해 R2R-CE에서 77.4% 성공률을 달성한 8B 규모의 시각-언어 네비게이션 모델이다.

    Arjun Majumdar, Avinash Sooriyarachchi, Benjamin Tibi, Chris Bamford, Elliot Chane-Sane

  23. #32Predictive Divergence Masks for LLM RL

    PPO 기반 방향 기준의 한계를 보완한 predictive divergence mask를 제안하여 LLM RL의 훈련 안정성과 효과성을 개선한다.

    Xiangxin Zhou, Jiarui Yao, Penghui Qi, Bowen Ping, Jiaqi Tang

  24. #33FVAttn: Adaptive Sparse Attention with Runtime Load Balancing for Video Generation

    FVAttn은 다중 GPU 환경에서 실행 효율성을 향상시키는 적응형 희소 어텐션 시스템으로, 런타임 로드 밸런싱과 슬랙 인식 희소 증강을 통해 어텐션 속도를 4.41배 개선한다.

    Hao Liu, Chenghuan Huang, Ye Huang, Zhiying Wen, Hao Liu

  25. #34ATSplat: Compact Feed-forward 3D Gaussian Splatting with Adaptive Token Expansion

    ATSplat은 적응형 토큰 확장을 통해 3D Gaussian Splatting의 장점을 복원한 실시간 렌더링 성능을 갖는 컴팩트한 피드포워드 프레임워크이다.

    Cho In, Jeonghwan Cho, Mijin Yoo, Gim Hee Lee, Seon Joo Kim

인기 키워드

reinforcement-learning (260) llm (147) diffusion-models (136) llm-agents (116) vlm (101) video-generation (90) transformer (86) llm-evaluation (83) long-context (69) vision-language (65) code-generation (62) benchmark-evaluation (61) long-horizon (59) retrieval-augmented (55) foundation-models (52) text-to-image (52) flow-matching (50) large-language-models (50) benchmarking (49) language-models (47)