HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-08-25 featured 논문 30편

  1. #1Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing

    Magpie는 Llama-3-Instruct를 사용해 400만 개의 인스트럭션 데이터를 자동 생성하고, 이 중 30만 개의 고질량 데이터로 모델 퍼포먼스를 향상시키는 방식을 제안한다.

    Zhangchen Xu, Fengqing Jiang, Luyao Niu, Yuntian Deng, R. Poovendran

  2. #2NAVSIM: Data-Driven Non-Reactive Autonomous Vehicle Simulation and Benchmarking

    NAVSIM은 비반응형 시뮬레이션과 대규모 데이터셋을 결합하여 자율주행 정책을 평가하는 새로운 벤치마킹 프레임워크이다.

    Daniel Dauner, Marcel Hallgarten, Tianyu Li, Xinshuo Weng, Zhiyu Huang

  3. #3Pyramidal Flow Matching for Efficient Video Generative Modeling

    파이라미달 플로우 매칭을 통해 768p 24fps 10초 영상을 20.7k A100 GPU 시간 내 생성하는 효율적 비디오 생성 모델 제안.

    Yang Jin, Zhicheng Sun, Ning Li, Kun Xu, Hao Jiang

  4. #4GS-LRM: Large Reconstruction Model for 3D Gaussian Splatting

    GS-LRM은 2~4장의 투영 이미지에서 0.23초 내 3D 가우시안을 생성하는 빠르고 확장 가능한 트랜스포머 기반 모델이다.

    Kai Zhang, Sai Bi, Hao Tan, Yuanbo Xiangli, Nanxuan Zhao

  5. #5From Slow Bidirectional to Fast Autoregressive Video Diffusion Models

    CausVid는 비동기적 비디오 생성을 위한 자동 회귀 디퓨전 트랜스포머로, 9.4 FPS 속도로 30초 길이의 고해상도 비디오를 생성한다.

    Tianwei Yin, Qiang Zhang, Richard Zhang, William T. Freeman, Frédo Durand

  6. #6Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean Data

    RADD는 시간 조건을 제거한 이산 확장 확산 모델로, 5개 제로샷 언어 모델링 벤치마크에서 최고 성능을 달성했다.

    Jingyang Ou, Shen Nie, Kaiwen Xue, Fengqi Zhu, Jiacheng Sun

  7. #7A StrongREJECT for Empty Jailbreaks

    StrongREJECT은 기존 벤치마크보다 인간 평가와 높은 일관성을 보이는 새로운 제일브레이크 평가 기준을 제시한다.

    Alexandra Souly, Qingyuan Lu, Dillon Bowen, Tu Trinh, Elvis Hsieh

  8. #8One Step Diffusion via Shortcut Models

    Shortcut 모델은 단일 네트워크와 학습 단계로 1단계 생성이 가능한 확산 기반 생성 모델이다.

    Kevin Frans, Danijar Hafner, Sergey Levine, Pieter Abbeel

  9. #9Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning

    Visual CoT는 438k 질문-답변 쌍을 포함한 대규모 데이터셋과 MLLM의 해석 가능성 향상을 위한 다단계 처리 파이프라인을 제안한다.

    Hao Shao, Shengju Qian, Han Xiao, Guanglu Song, Zhuofan Zong

  10. #10TempCompass: Do Video LLMs Really Understand Videos?

    TempCompass는 Video LLM의 시간 인지 능력을 체계적으로 평가하기 위한 새로운 벤치마크로, 8개의 최신 Video LLM이 시간 인지 능력에서 부족함을 드러냄.

    Yuanxin Liu, Shicheng Li, Yi Liu, Yuxiang Wang, Shuhuai Ren

  11. #296PhysCaP: Grounding Code-as-Policy Agent with Physics-Informed Exploration

    PhysCaP는 물리 정보 기반 탐색을 도입한 Code-as-Policy 에이전트로, 물체의 질량과 강성 추정을 통해 효율적인 로봇 조작을 가능하게 한다.

    Chen-Yu Lin, Jing-Wen Chen, Hsueh-En Chang, Hung-An Chen, Sheng-Hsun Chang

  12. #302EnvHarness: Awakening Static Worlds for Agent Learning

    EnvHarness는 정적 환경을 프로그래밍 가능한 레이어로 변환하여 에이전트 학습을 개선하는 시스템이다.

    Chengsong Huang, Zifeng Wang, Rujun Han, Jun Yan, Yanfei Chen

  13. #303GOAG: Generative and Object-Agnostic Grasp Planner for Dexterous Robotic Manipulation

    GOAG는 객체-무관한 다지 다exterous 그립 계획을 위한 생성 모델로, MultiDex 데이터셋에서 86.93%의 성공률을 달성했다.

    Julien Merand, Boris Meden, Mathieu Grossard, Liming Chen

  14. #304FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis

    FACET은 실행 가능한 터미널 태스크를 생성하면서 원본 의도와 실행 상태를 보존하는 프레임워크로, Terminal-Bench 2.1에서 47.57의 성능을 달성했다.

    Kou Shi, Zun Wang, Qisheng Su, Shiting Huang, Ziao Zhang

  15. #305τ_0-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation

    τ₀-VLA는 세계 모델을 활용한 계산 확장 추론을 통해 장기적 로봇 조작 성능을 향상시키는 계층형 기반 모델이다.

    Xiaowei Cai, Yunuo Cai, Bingao Chen, Jingxiao Chen, Zhi Chen

  16. #306EXIMO: VLM Guided Exploration of VLA Policies

    EXIMO는 VLM을 활용한 VLA 정책의 샘플 효율적 학습을 위한 3단계 알고리즘으로, 기존 방법 대비 성능과 효율성을 향상시킨다.

    Bhavya Sukhija, Oliver Groth, Mohit Shridhar, Tim Hertweck, Michael Bloesch

  17. #3074DAnyone: Create Anyone in 4D from a Casual Monocular Video

    4DAnyone은 단일 카메라 영상에서 4D 인간을 재구성하는 프레임워크로, RCP와 TCR을 통해 다중 뷰 일관성을 달성한다.

    Yudong Jin, Tao Xie, Qihang Zhang, Zehong Shen, Zhen Xu

  18. #308SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?

    SWE-bench Science는 과학 소프트웨어 엔지니어링을 평가하기 위한 레포지토리 수준 벤치마크로, Claude Code with Opus-5 (max)의 pass@1이 50% 미만임을 보여준다.

    Zhipeng Xu, Jiahao Lu, Yining Zheng, Yuxin Wang, Xipeng Qiu

  19. #309TinyCast: Probabilistic Zero-Shot Forecasting with Computed Periodicity

    TinyCast는 146,505개의 파라미터로 주기성을 계산하고 확률적 예측을 제공하는 attention-free zero-shot 예측 모델이다.

    Armin Steinhauser

  20. #310Decision Tree and K-Means Analysis of Raman Spectra for Edible Oils: A Physics-Informed AI Approach

    람ان 분광과 결정 트리, K-평균 클러스터링을 결합한 물리 기반 AI를 활용한 식용유 인증 방법을 제시한다.

    Amrita Shaw, Chandrasekar S. N., Sai Muthukumar V., Jhinuk Gupta, Deepak L. N. Kallepalli

  21. #311WithEveryone: Unified Planning and Identity Grounding for Group Image Generation

    WithEveryone은 최대 10명의 참조 신원을 포함한 그룹 이미지 생성을 위한 통합 프레임워크로, 신원 유지를 향상시키며 복사-붙여넣기 아티팩트를 감소시킨다.

    Hengyuan Xu, Qixun Wang, Yiji Cheng, Miles Yang, Zhao Zhong

  22. #312Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts

    대규모 MoE 모델의 학습률 최적화를 위해 계산 효율적인 2단계 하이퍼파라미터 전이 프레임워크를 제안한다.

    Nayeon Kim, Hojin Lee, Yunju Bak, Jaesun Park, Boseop Kim

  23. #313MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use

    MemTrapBench는 LLM의 메모리 사용 시 발생하는 인지 함정을 평가하는 벤치마크로, AdaptiveMem이라는 간단한 추론 시 보완 전략을 제안한다.

    Mengru Wang, Haozhe Luo, Zhenqian Xu, Zhixiang Cui, Haoming Xu

  24. #314InfinityEdit: Infinite Video Editing with a Lightweight Edit-Ignition Adapter

    InfinityEdit은 무한 비디오 편집을 위한 경량 편집 어댑터로, 실시간 스트림에 편집을 지속적으로 적용하는 문제를 해결한다.

    Yunze Tong, Mushui Liu, Canyu Zhao, Shiyi Zhang, Didi Zhu

  25. #315SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback

    SkillEvo는 다중 턴 인터랙션 피드백을 기반으로 신뢰할 수 있는 진화 경사를 생성하고, 구조적 지식 시스템을 유지하며 스킬을 지속적으로 개선하는 프레임워크이다.

    Qianxi Yan, Chunrong Chen, Jiuzhou Zhao, Min Zhang, Yongzhou Xu

  26. #316Graph Engineering in the Era of LLM Agents: From Individual Intelligence to System Intelligence

    LLM 에이전트 시스템의 복잡성을 관리하기 위해 그래프 기반 구조를 도입한 System Intelligence와 Graph Engineering 패러다임을 제시한다.

    Yuyuan Feng, Zhishang Xiang, Chaobin Yang, Qichao Ma, Zerui Chen

  27. #317ParaTempo: Efficient Parallel Reasoning via Temporal Confidence

    ParaTempo는 시간적 신뢰도를 기반으로 병렬 추론 과정을 효율적으로 제어하여, 수학 및 과학적 추론에서 21.8–32.2%의 지연 감소와 18.1–30.3%의 토큰 사용 감소를 달성한 비학습형 비동기 프레임워크이다.

    Xuteng Zhang, Wenhao Zeng, Xiaodong Gu, Chao Hu, Haotian Lin

  28. #318OmniAssistBench: Assistant-style Interaction Benchmark for Omni-LLMs

    OmniAssistBench는 실시간 비디오 어시스턴트로 활용되는 Omni-LLMs의 상호작용 능력을 평가하기 위한 새로운 벤치마크로, 기존 모델들의 시각적 지시, 장기 기억, 지연 응답 등에서 한계를 드러냈다.

    Xianyun Sun, Chaoyou Fu, Zhengye Zhang, Feiyang Duan, Qingyuan Cao

  29. #319ForgeWM: Progressive Causal Training for Few-Step Action-Conditioned Video World Models

    ForgeWM은 게임 네이티브 컨트롤을 유지하면서 1~4단계의 저지연 동작 조건 비디오 월드 모델을 생성하는 프로그레시브 인과 학습 프레임워크이다.

    Xinye Li, Lingshuai Lin, Lei Wang, Liuzhou Zhang, Jialin Cui

  30. #320Repo0: Design-Driven Zero-to-All Code Generation

    Repo0는 자연어 요구사항에서 전체 소프트웨어 프로젝트를 생성하는 구조적 진화 프레임워크이다.

    Silin Chen, Haoyi Teng, Xiaodong Gu, Yuling Shi, Jiale Huang

인기 키워드

reinforcement-learning (331) diffusion-models (190) llm (190) llm-agents (160) video-generation (129) transformer (126) llm-evaluation (125) vision-language (112) vlm (109) long-context (99) large-language-models (94) code-generation (88) long-horizon (86) benchmark-evaluation (82) benchmarking (80) language-models (75) retrieval-augmented (73) flow-matching (68) world-models (68) foundation-models (67)