HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-08-16 featured 논문 30편

  1. #1DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation

    DreamX-Phi 1.0은 언어 지시와 로봇 동작을 조건으로 미래 장면을 예측하는 조건부 영상 월드 모델로, WorldArena 2.0에서 Track 1 1위, Track 2 2위를 달성했다.

    DreamX Team, Rui Chen, Xiangxiang Chu, Geng Li, Jifan Li

  2. #2UMA: A Family of Universal Models for Atoms

    UMA는 5억 개 이상의 3D 원자 구조를 학습한 대규모 원자 모델로, Mixture of Linear Experts(MoLE) 아키텍처를 통해 정확도와 속도를 동시에 달성한다.

    Brandon M. Wood, Misko Dzamba, Xiang Fu, Meng Gao, M. Shuaibi

  3. #3Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?

    현재 RLVR은 기존 LLM의 추론 능력을 확장하지 못하며, 기반 모델의 범위 내에서만 작동한다.

    Yang Yue, Zhiqin Chen, Rui Lu, Andrew Zhao, Zhaokai Wang

  4. #4Large Language Diffusion Models

    LLaDA는 확률적 추론을 위한 확산 모델 기반 대규모 언어 모델로, 기존 자동회귀 모델과 유사한 성능을 보인다.

    Shen Nie, Fengqi Zhu, Zebin You, Xiaolu Zhang, Jingyang Ou

  5. #5H2R-Bench: Benchmarking Human-to-Robot Manipulation Video Generation in World Models

    H2R-Bench는 인간 조작 영상을 로봇 중심 조작 영상으로 전환하는 능력을 평가하는 벤치마크로, 6개 조작 유형과 2개 로봇 구조에서 11개 모델을 평가한다.

    Dingyi Rong, Yue Shi, Chaofan Ma, Jiezhang Cao, Zongrui Wang

  6. #6Flow-GRPO: Training Flow Matching Models via Online RL

    Flow-GRPO는 온라인 강화학습을 플로우 매칭 모델에 통합한 최초의 방법으로, GenEval 정확도를 63%에서 95%까지 향상시킨다.

    Jie Liu, Gongye Liu, Jiajun Liang, Yangguang Li, Jiaheng Liu

  7. #7Search-o1: Agentic Search-Enhanced Large Reasoning Models

    Search-o1은 OpenAI-o1과 같은 대규모 추론 모델의 지식 부족 문제를 해결하기 위해 에이전트 기반 검색 및 문서 내 추론 모듈을 결합한 프레임워크이다.

    Xiaoxi Li, Guanting Dong, Jiajie Jin, Yuyao Zhang, Yujia Zhou

  8. #8MM-LLMs: Recent Advances in MultiModal Large Language Models

    지난 1년간 MM-LLMs가 비용 효율적인 훈련 전략을 통해 다양한 멀티모달 작업을 지원하며 발전하고 있다.

    Duzhen Zhang, Yahan Yu, Chenxing Li, Jiahua Dong, Dan Su

  9. #9Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation

    Janus는 시각 인코딩을 분리하여 멀티모달 이해와 생성을 통합하는 자동회귀 프레임워크이다.

    Chengyue Wu, Xiaokang Chen, Zhiyu Wu, Yiyang Ma, Xingchao Liu

  10. #10LongMemEval: Benchmarking Chat Assistants on Long-Term Interactive Memory

    LongMemEval은 대화형 챗봇의 장기 기억 능력을 평가하는 벤치마크로, 500개의 질문과 세 가지 단계의 메모리 설계 최적화를 제시한다.

    Di Wu, Hongwei Wang, Wenhao Yu, Yuwei Zhang, Kai-Wei Chang

  11. #11LoRA+: Efficient Low Rank Adaptation of Large Models

    LoRA+는 LoRA의 효율성을 개선한 저랭크 튜닝 알고리즘으로, A와 B 행렬에 서로 다른 학습률을 적용하여 성능과 학습 속도를 향상시킨다.

    Soufiane Hayou, Nikhil Ghosh, Bin Yu

  12. #12The Lessons of Developing Process Reward Models in Mathematical Reasoning

    수학적 추론에서 과정 오류를 감지하는 Process Reward Model(PRMs)의 개발 과정에서 MC 추정법의 한계와 BoN 평가 전략의 편향을 분석하고, 이를 개선한 새로운 합의 필터링 메커니즘을 제안한다.

    Zhenru Zhang, Chujie Zheng, Yang Wu, Beichen Zhang, Runji Lin

  13. #227Alaya-EVOKE: From Linear-Scaling Supervision to Endless World

    Evoke는 지속적 세계 상태를 외부 기하 메모리에 분리하고, 선형 확장의 지도를 통해 3단계 생성자로 장기적 상호작용을 가능하게 하는 세계 모델이다.

    Yuanyang Yin, Gongxuan Wang, Yifan Zhan, Chuanhao Li, Kaipeng Zhang

  14. #306Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning

    CaRL을 통해 LLM이 무의미한 추론을 중단하고 능력 경계에 맞춘 행동을 학습한다.

    Xinyan Guan, Jiali Zeng, Chunlei Xin, Yaojie Lu, Hongyu Lin

  15. #307PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives

    PlayWorld는 장기적 목표 기반의 대체적 에이전트 플레이어를 통해 비디오 월드 모델을 평가하는 벤치마크를 제시한다.

    Kaixin Ding, Xi Chen, Minghong Cai, Zhiyuan Xu, Yiyang Wang

  16. #308Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence

    SMA는 학습 없이 공간 경험을 재사용 가능한 교훈으로 전환하여 동결된 VLM의 공간 추론을 향상시키는 런타임 프레임워크이다.

    Haokai Zhang, Yuhang Ding, Yunshu Zhou, Xinze Du, Shengtao Zhang

  17. #309LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers

    LLMRouter는 다양한 LLM 라우팅 정책을 개발·평가·배포하는 통합 인프라로, 16개 이상의 라우터와 xRouteBench 벤치마크를 제공하며 14.6%의 상대 성능 향상을 보인다.

    Tao Feng, Fangxu Yu, Haozhen Zhang, Zhongjie Dai, Liangqi Yuan

  18. #312DarwinX: Evolving Agent Harnesses Through Natural Selection

    DarwinX는 모델 가중치를 고정한 상태에서 헤이버스를 진화시켜 LLM 에이전트의 일반적 역량을 향상시키는 자연선택 기반 프레임워크이다.

    Yifan Zhang, Yutong Dai, Juntao Tan, Luyu Yang, Rishi Mullur

  19. #313Learning How the World Evolves: Extrapolative Video World Models via Latent Dynamics Reasoning

    LDR은 구조화된 잠재 공간에서 운동적 통합을 통해 동적을 학습하고, 기존 비전 확산 모델보다 훨씬 빠르고 정확하게 외삽하는 비디오 월드 모델이다.

    Haodong Li, Shaoteng Liu, Tianyu Wang, Chongjian Ge, Sihui Ji

  20. #314Intern-S2-Preview: Scientific Agentic Foundation Model

    Intern-S2-Preview-397B는 과학적 추론, 도구 상호작용, 장기적 작업을 지원하는 다중 모달 과학 에이전트 기반 모델이다.

    Lei Bai, Jiaqi Cao, Chiyu Chen, Guanzhou Chen, Kai Chen

  21. #315How Can Rhetoric Reward-Hack AI Reviewers? Dissecting Rhetorical Sensitivity in AI-Based Peer Review

    AI 리뷰어의 판단이 과학적 내용을 유지하면서도 수사적 표현에 따라 달라질 수 있음을 밝힌 연구.

    Ming Li, Chenguang Wang, Xirui Li, Xinyue Zeng, Dianqi Li

  22. #316AVA-Encoder: Towards Agent-Native Video Representation Learning

    AVA-Encoder는 영화 콘텐츠를 에이전트가 이해하고 편집할 수 있는 구조화된 지식 그래프로 변환하여, 에이전트 네이티브 비디오 표현 학습을 구현한다.

    Chuyue Li, Jinpeng Yu, Haozhe Wang, Tian Xueyun, Zhijing Zhang

  23. #317AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design

    AutoDesign은 학술 논문을 포스터로 자동 생성하는 과정에서 인간 선호에 맞춘 재귀적 개선을 통해 78.32 점을 달성한 메타-해버 시스템 최적화 프레임워크이다.

    Yaxin Luo, Haobin Jiang, Jialv Zou, Xu Huang, Wenhao Yan

  24. #319Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus

    혼합형 선형 어텐션 대형 언어 모델(HLA LLM)에서 대규모 활성화(MA)의 두 가지 형태, pre-attention spikes(PAS)와 inter-spike plateaus(ISP)를 체계적으로 분석하고, 이들의 발생 메커니즘과 학습 과정에서의 변화를 밝혔다.

    Zunhai Su, Bohan Sun, Xialie Zhuang, Shuibai Zhang, He Xiao

  25. #320From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs

    저주파 수음 불가 신호가 대규모 오디오-언어 모델(LALM)의 안정성에 심각한 위협을 가하며, 이를 평가하고 완화하기 위한 ILL과 DRG 방법이 제안된다.

    Yuanhe Zhang, Weiliu Wang, Jie Ren, Liang Lin, Zhenhong Zhou

  26. #321Self-Geometry: GT-Free and Plug-and-Play Test-Time Adaptation for Geometrically Consistent 3D Vision Foundation Models

    Self-Geometry는 테스트 시에 2D 픽셀 대응 관계를 활용해 기하학적 일관성을 강제하는 플러그 앤 플레이형 3D 비전 모델 적응 파이프라인이다.

    Seokhyun Youn, Dahyeon Kye, Sung-Ho Bae, Jihyong Oh

  27. #322UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos

    UniSwap은 말하는 영상에서 시각적 외형과 음성을 실시간으로 통합 교체하는 첫 번째 스트리밍 프레임워크이다.

    Yuxuan Zhang, Haozhong Xiong, Jiayi Song, Jinpeng Yu, Yang Shi

  28. #323LiveAnimate: Stable Long-Form Streaming Human Animation in Real-Time

    LiveAnimate는 14B 파라미터 DiT 기반으로 실시간 스트리밍과 장시간 안정적 생성을 결합한 첫 번째 인간 애니메이션 시스템이다.

    Yuxuan Zhang, Haozhong Xiong, Yubo Huang, Jiayi Song, Jinpeng Yu

  29. #325TailBooster: A Dual-Layer Generative Framework for Extreme Value Augmentation with Operational Validity Enforcement

    TailBooster는 극단적 항공 운항 데이터를 생성하면서 운영 적합성을 보장하는 이중 계층 생성 프레임워크이다.

    Karim Aly, Alexei Sharpanskykh, Jacco Hoekstra

  30. #327Full-bandwidth transformer

    Full-bandwidth transformer는 토큰 단위 피드백 대신 전체 히든 상태를 재사용해 추론 성능을 향상시키며, 1.5배 더 많은 토큰으로 학습한 모델과 유사한 결과를 낸다.

    Xi Wang, Ziyang Cai, Zheng Zhan, Harry Dong, Ying Fan

인기 키워드

reinforcement-learning (331) diffusion-models (190) llm (190) llm-agents (160) video-generation (129) transformer (126) llm-evaluation (125) vision-language (112) vlm (109) long-context (99) large-language-models (94) code-generation (88) long-horizon (86) benchmark-evaluation (82) benchmarking (80) language-models (75) retrieval-augmented (73) flow-matching (68) world-models (68) foundation-models (67)