HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-07-21 featured 논문 25편

  1. #1Cura 1T: Specialized Model for Agentic Healthcare

    Cura 1T는 의료 분야의 대규모 언어 모델로, 인간 감독 하의 자기 진화 루프를 통해 의료 대화, 진단, EHR 도구 사용 등 복합적인 능력을 개선한 모델이다.

    actAVA AI, :, Haolin Chen, Leon Qi, Steve Brown

  2. #3Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories

    Xiaomi-Robotics-1은 10만 시간 이상의 실제 조작 데이터로 학습한 VLA 모델로, RoboCasa365에서 57.6% 성공률을 달성했다.

    Xiaomi Robotics Team, Jun Guo, Piaopiao Jin, Jason Li, Peiyan Li

  3. #4Recursive Harness Self-Improvement

    RHI는 사용자 정의 헤이브스를 반복적으로 개선하여 추론 비용을 줄이고 성능을 향상시키는 알고리즘이다.

    Hyunin Lee, Jinglue Xu, Jeffrey Seely, Donghyun Lee, Matei Zaharia

  4. #5DSWorld: A Data Science World Model for Efficient Autonomous Agents

    DSWorld는 데이터 과학 작업의 효율성을 높이기 위해 작업 흐름의 상태 전이를 예측하는 모델로, RL 기반 학습을 14배, 추론을 3~6배 가속화한다.

    Zherui Yang, Fan Liu, Hao Liu

  5. #10RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources

    RESOURCE2SKILL은 멀티모달 자료를 실행 가능한 에이전트 스킬로 추출하는 프레임워크로, 7개 도메인에서 평균 +11.9% 성능 향상을 보인다.

    Yijia Fan, Zonglin Di, Zimo Wen, Yifan Yang, Mingxi Cheng

  6. #11RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM

    RAGU는 다단계 그래프 기반 RAG 엔진으로, Meno-Lite-0.1이라는 7B 언어 기술 최적화 모델을 통해 그래프 추출 정확도를 12.5% 개선한다.

    Mikhail Komarov, Ivan Bondarenko, Stanislav Shtuka, Oleg Sedukhin, Roman Shuvalov

  7. #13S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and Generation

    S1-Omni는 과학적 이해, 예측, 생성을 위한 통합 멀티모달 추론 모델로, 200개 과학 태스크와 60개 이상의 벤치마크에서 GPT-5.5 및 Gemini-3.1-Pro를 능가한다.

    Jiahao Zhao, Junyi Liu, Lifeng Xu, Nan Xu, Qingli Wang

  8. #15Loop the Loopies!

    Loopie는 기존 루프형 트랜스포머의 한계를 극복한 고성능 MoE 모델이다.

    Zitian Gao, Yilong Chen, Yihao Xiao, Xinyu Yang, Ran Tao

  9. #18xHC: Expanded Hyper-Connections

    xHC는 N=4 이상의 잔류 스트림 확장을 효과적이고 계산 효율적으로 만드는 새로운 Hyper-Connections 기법이다.

    Xiangdong Zhang, Xiaohan Qin, Sunan Zou, Tuo Dai, Xiaoming Shi

  10. #23On-Policy Delta Distillation

    On-Policy Delta Distillation(OPD²)은 기존의 on-policy distillation에서 teacher 모델의 output distribution을 모방하는 대신, teacher와 base 모델 간의 delta signal을 활용해 추론 능력을 효과적으로 전달하는 새로운 방법이다.

    Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han

  11. #25RecGPT-V3 Technical Report

    RecGPT-V3는 Taobao 추천 시스템에서 사용자 이해와 추천 효율성을 동시에 향상시키는 LLM 기반 추천 모델로, Memory Hub, Hybrid-modal Foundation Model, Latent Intent Reasoning를 통해 성능과 자원 소비를 개선한다.

    Bowen Zheng, Chao Yi, Dian Chen, Gaoyang Guo, Han Zhu

  12. #26From Human-Centric to Agentic Code Review: The Impact of Different Generations of Generative AI Technology on Review Quality

    AI 리뷰 참여가 리뷰 효율성은 향상시키지만 품질 개선으로 이어지지 않음.

    Suzhen Zhong, Shayan Noei, Bram Adams, Ying Zou

  13. #28Qwen-Music Technical Report

    Qwen-Music은 텍스트와 레퍼런스 음악 기반으로 고음질 음악을 생성하는 대규모 음악 생성 모델로, Melody-CoT와 Qwen-Music-Render를 통해 창의성과 음향 품질을 동시에 향상시킨다.

    Jin Xu, Kangdi Wang, Ruibin Yuan, Shun Lei, Xiong Wang

  14. #29Understanding Reasoning from Pretraining to Post-Training

    체스를 사용한 제어된 실험 환경에서 사전학습과 강화학습의 상호작용을 정량적으로 분석하여, 사전학습 데이터량과 모델 규모가 강화학습 성능에 미치는 영향을 규명했다.

    Jingyan Shen, Ang Li, Salman Rahman, Yifan Sun, Micah Goldblum

  15. #33When Does Muon Help Agentic Reinforcement Learning?

    Muon이 GiGPO 기반의 장기적 희소보상 에이전트 강화학습에서 AdamW 대비 88% 성능 향상을 보인다.

    Kai Ruan, Jinghao Lin, Zihe Huang, Ziqi Zhou, Qianshan Wei

  16. #34Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel

    12B 규모의 언어 모델에 검증된 지식을 바이트 단위로 이식하여 정확도를 80.0%에서 93.3%로 높이고, 추론 비용을 6,574배 절감하는 기술을 제시한다.

    Sietse Schelpe

  17. #35Token Time Continuous Diffusion for Language Modeling

    TTCD는 토큰별 시간 개념을 도입한 연속 확산 언어 모델로, 빠른 속도에서도 생성 성능을 유지한다.

    Parikshit Bansal, Sujay Sanghavi

  18. #36AsySplat: Efficient Asymmetric 3D Gaussian Splatting for Long-Sequence Scene Modeling

    AsySplat은 3D Gaussian Splatting에서 계산 중복을 줄이기 위해 기하학과 외관 모델링을 분리한 비대칭 구조를 제안하여, 800× 가속과 30% 파라미터 감소를 달성한다.

    Yingji Zhong, Dave Zhenyu Chen, Fuzhao Ou, Youyu Chen, Zhihao Li

  19. #38Partition, Prompt, Aggregate: Statistical Self-Consistency in Language Models

    LLM이 통계적 자기일관성을 얼마나 잘 따르는지 평가하는 연구.

    Patrik Wolf, Thomas Kleine Buening, Andreas Krause, Celestine Mendler-Dünner

  20. #39SeerGuard: A Safety Framework for Mobile GUI Agents via World Model Prediction

    SeerGuard는 모바일 GUI 에이전트의 안전성을 향상시키기 위해 실행 전 예측 기반의 지시 및 행동 수준 위험 평가를 결합한 안전 프레임워크이다.

    Xue Yu, Bo Yuan, Pengshuai Yang, Kailin Zhao, Hong Hu

  21. #40Conditional Reliability of Toxicity Signals for Multilingual and Code-Mixed Abuse Detection

    ToxGate는 조건부 신뢰성을 고려한 토스 신호 융합 모듈로, 다국어 및 코드미싱 폭언 탐지 성능을 개선한다.

    Indraveni Chebolu, Rohan Singh, Arnab Mallick, Harmesh Rana

  22. #41Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization

    CPO는 참조 기반 생성과 일반 생성 간의 토큰 수준 대조 차이를 활용해 RLVR에서 정확성 인식형 advantage shaping을 구현한다.

    Weiwen Xu, Jia Liu, Hou Pong Chan, Long Li, Deng Cai

  23. #42Rethinking the Evaluation of Harness Evolution for Agents

    LLM 에이전트의 하버스 진화 평가 프로토콜을 재검토하고, 기존 평가 방식의 한계를 드러냄.

    Yike Wang, Huaisheng Zhu, Zhengyu Hu, Yige Yuan, Zhengyu Chen

  24. #43REBASE: Reference-Background Subspace Elimination for Training-Free In-Context Segmentation

    REBASE는 훈련 없이 배경 특성 공간을 제거하여 단일 참조 이미지로 쿼리 이미지의 세그멘테이션 성능을 향상시키는 새로운 인-컨텍스트 세그멘테이션 프레임워크이다.

    Mantha Sai Gopal, Jaison Saji Chacko, Harsh Nandwana, Sandesh Hegde, Debarshi Banerjee

  25. #44VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders

    VideoRAE는 Video Foundation Models(VFMs)의 냉동 표현을 활용하여 고정밀 비디오 생성을 지원하는 새로운 표현 오토인코더를 제안한다.

    Zhihao Xie, Junfeng Wu, Xinting Hu, Junchao Huang, Li Jiang

인기 키워드

reinforcement-learning (251) llm (146) diffusion-models (132) llm-agents (113) vlm (100) transformer (86) llm-evaluation (82) video-generation (82) long-context (68) vision-language (60) benchmark-evaluation (59) code-generation (58) long-horizon (57) retrieval-augmented (55) foundation-models (51) text-to-image (51) flow-matching (50) large-language-models (48) language-models (47) benchmarking (45)