HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-08-01 featured 논문 30편

  1. #1PhiZero: A World Model Built Around Physical Language

    PhiZero는 물리적 세계의 진화를 추론-렌더링 방식으로 모델링하는, 물리적 언어 기반의 월드 모델이다.

    Shuyao Shang, Yuqi Wang, Ruopeng Gao, Xu Chen, Tieniu Tan

  2. #2VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System

    VideoCoCo는 실행 가능한 코드를 이용해 물리적으로 일관된 동영상을 생성하는 이중 엔진 시스템을 제안한다.

    Haodong Li, Tianfei Ren, Xiaoxiao Ma, Chunmei Qing, Zhen Fang

  3. #3Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations

    VPP는 VDM 내 예측적 시각 표현을 활용해 로봇 정책 성능을 18.6~28.8% 개선한 일반적 정책이다.

    Yucheng Hu, Yanjiang Guo, Pengchao Wang, Xiaoyu Chen, Yen-Jen Wang

  4. #4LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code

    LiveCodeBench는 코드 생성 외에도 디버깅, 실행, 테스트 예측을 포함한 코드 관련 능력을 종합적으로 평가하는, 오염 없는 대규모 언어 모델 평가 벤치마크이다.

    Naman Jain, King Han, Alex Gu, Wen-Ding Li, Fanjia Yan

  5. #5LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models

    LlamaFactory는 100개 이상의 언어 모델을 코드 없이 맞춤형으로 미세 조정할 수 있는 통합 프레임워크로, 다양한 효율적 학습 기법을 지원한다.

    Yaowei Zheng, Richong Zhang, Junhao Zhang, Yanhan Ye, Zheyan Luo

  6. #6Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality

    Transformer와 SSM은 구조적 상태 공간 이중성으로 연결될 수 있다.

    Tri Dao, Albert Gu

  7. #7M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation

    M3-Embedding은 다국어, 다기능, 다단위를 지원하는 최초의 텍스트 임베딩 모델로, 자기 지식 증류와 최적화된 배치 전략을 통해 다양한 검색 성능을 달성한다.

    Jianlv Chen, Shitao Xiao, Peitian Zhang, Kun Luo, Defu Lian

  8. #8VGGT: Visual Geometry Grounded Transformer

    VGGT는 3D 장면 속 카메라 파라미터, 포인트 맵, 깊이 맵 등을 단일 패스로 추정하는 트랜스포머 기반 신경망이다.

    Jianyuan Wang, Minghao Chen, Nikita Karaev, Andrea Vedaldi, Christian Rupprecht

  9. #9SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering

    SWE-agent는 LM 에이전트가 소프트웨어 엔지니어링 작업을 자동화하도록 돕는 ACI 시스템이다.

    John Yang, Carlos E. Jimenez, Alexander Wettig, Kilian Adriano Lieret, Shunyu Yao

  10. #10Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis

    Video-MME는 비디오 분석에서 MLLM의 다중 모달 성능을 평가하는 최초의 종합적 벤치마크로, 900개의 영상과 2,700개의 QA 쌍으로 구성되어 있다.

    Chaoyou Fu, Yuhan Dai, Yondong Luo, Lei Li, Shuhuai Ren

  11. #11Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference

    Chatbot Arena는 240K 이상의 사용자 투표를 바탕으로 LLM을 인간 선호도 기반으로 평가하는 오픈 플랫폼이다.

    Wei-Lin Chiang, Lianmin Zheng, Ying Sheng, Anastasios Nikolas Angelopoulos, Tianle Li

  12. #12s1: Simple test-time scaling

    s1-32B 모델은 1,000개의 s1K 데이터셋과 budget forcing 기법을 통해 o1-preview를 27% 초과하는 수학 문제 해결 성능을 달성했다.

    Niklas Muennighoff, Zitong Yang, Weijia Shi, Xiang Lisa Li, Fei-Fei Li

  13. #19EvoPINN: Agentic Discovery of Executable Algorithms for Physics-Informed Neural Networks

    EvoPINN은 LLM 기반 에이전트를 활용해 PDE 특화 학습 알고리즘을 자동으로 발견하는 실행 기반 프레임워크로, SLRC-PINN 아키텍처를 독자적으로 개발해 기존 방법 대비 L2 오차를 감소시킨다.

    Peng Yin, Kai Li, Yifan Zhang, Jian Cheng

  14. #20Recursive transformers for semiconductor thermo-mechanical reliability

    반도체 열기계 신뢰성 분석을 위한 재귀 트랜스포머 모델의 성능과 효율성을 비교 평가한 연구.

    Kart-leong Lim

  15. #29MPIE-Bench: Benchmarking Anatomically Plausible Multi-Person Interaction Editing

    MPIE-Bench는 다인물 상호작용 편집의 해부학적 일관성을 평가하기 위한 2,500개 샘플의 벤치마크와 MPIE-Eval이라는 새로운 평가 프로토콜을 제안한다.

    Jiajia Lin, Mingxuan Du, Tuowen Zhou, Benfeng Xu, Hongtao Xie

  16. #38Σ-Mem: An Online Reliability Memory for LLM-based Multi-Agent Systems

    Σ-Mem은 LLM 기반 다중 에이전트 시스템에서 신뢰도를 기반으로 동적으로 조정하는 온라인 메모리 시스템이다.

    Peilin Feng, Suorong Yang, Soujanya Poria

  17. #85ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine

    ACE-Data-0은 실내 환경에서 사람-객체 상호작용을 다중 센서로 동기화 기록한 대규모 데이터셋이다.

    Yukang Cao, Haozhe Xie, Beichen Wen, Runmao Yao, Yinghao Liu

  18. #308OVEarth-Bench: Evaluating Category Breadth and Query Diversity for Open-Vocabulary Earth Observation

    OVEarth-Bench는 지구 관측 이미지에서 개방형 어휘와 다양한 질의 유형을 평가하는 새로운 벤치마크로, MLLM 기반 모델이 가장 우수한 성능을 보인다.

    Kaiyu Li, Zepeng Xin, Zixuan Jiang, Jing Fu, Lanxuan Xue

  19. #309CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition

    CLBench-V는 다중 모달 컨텍스트 학습을 평가하기 위한 벤치마크로, 3,443개 인스턴스에서 최고 점수 0.2847를 기록하며 모델의 한계를 드러낸다.

    Lai Wei, Chengqi Li, Jiapeng Li, Ruina Hu, Yue Wang

  20. #310Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents

    Qwen-UI-Agent는 실제 모바일 기기와 크로스 플랫폼 환경에서 뛰어난 성능을 보이는 GUI 에이전트로, 92.2%의 MobileWorld-Real 정확도를 달성했다.

    Hanzhang Zhou, Panrong Tong, Xu Zhang, Quyu Kong, Chenglin Cai

  21. #311Metis: Memory Foundation Model

    Metis는 기존의 외부 메모리 모듈을 대체하는 첫 번째 내재 메모리 기반 모델로, 메모리 상태와 절차를 모델 내부에 통합하여 효율적이고 유연한 메모리 처리를 가능하게 한다.

    Zeyu Zhang, Ziliang Guo, Yihang Sun, Xichong Zhang, Xixuan Hao

  22. #312AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis

    AskChem은 문서 중심 검색 대신, 과학적 주장(claim)을 중심으로 화학 문헌을 통합하는 인프라를 제시한다.

    Bing Yan, Gregory Wolfe, Stefano Martiniani, Kyunghyun Cho

  23. #313Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering

    Frontis-MA1은 MLE 분야에서 재귀적 자기 개선을 위한 AI4AI 모델로, OpenMLE 스택과 연계해 Medal Average 60.61%를 달성한다.

    Junlin Yang, Che Jiang, Yu Fu, Tianwei Luo, Can Ren

  24. #314ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow

    ShadowDancer는 동영상과 그림자 쌍을 통해 동작을 학습하여 다양한 동역학에 대한 프레임 수준의 정밀 제어를 가능하게 하는 새로운 인터페이스를 제시한다.

    Jin Cao, Zian Meng, Kaipeng Zhang

  25. #315StatePlay: State-Aware Game World Models for Mechanics-Consistent Generation

    StatePlay는 게임 내부 상태를 예측하여 기계적 일관성을 유지하는 첫 번째 상태 인식 게임 월드 모델이다.

    Zijun Lin, Zeqing Wang, Cheston Tan, Bihan Wen, Yeying Jin

  26. #316DistillAlign: Coordinating Mode Covering and Mode Seeking in Autoregressive Video Distillation

    DistillAlign은 DMD와 CD를 결합하여 초기화와 최종 정제 단계의 분포 일치를 동시에 달성하는 비디오 디스틸레이션 방법이다.

    Jiaxing Li, Kai Zou, Cindy Zhou, Kaichen Huang, Junyao Gao

  27. #317CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization

    CoRT는 토큰 수준의 크레딧 할당을 위해 카운터패클 레플레이를 활용한 GRPO 개선 방법으로, 평균 4.4%포인트 성능 향상을 보인다.

    Bo-Wen Zhang, Junwei He, Wen Wang, Song-Lin Lv, Wentao Ma

  28. #318ICLE++: Modeling Fine-Grained Traits for Holistic Essay Scoring

    ICLE++는 다중 특성 평가를 위한 새로운 어조화 에세이 점수 데이터셋이다.

    Shengjie Li, Vincent Ng

  29. #319Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory

    Memory Decoder at Scale는 6.9B 파라미터 규모로 확장된 장기 기억 모듈을 제안하여 언어 모델 성능을 파라미터 효율적으로 향상시킨다.

    Rubin Wei, Jiaqi Cao, Jiarui Wang, Junming Zhang, Qipeng Guo

  30. #320Beacon: Knowing When and How to Perform Agentic Visual Reasoning

    Beacon은 도구 사용의 적절성과 효과성을 동시에 향상시킨 새로운 에이전트형 시각 추론 모델로, 강화 학습 기반의 Necessity-Aware Adaptive Reward와 Hint-Guided Capability Expansion을 핵심으로 한다.

    Qixun Wang, Yang Shi, Letian Cheng, Zhuoran Zhang, Yan He

인기 키워드

reinforcement-learning (272) llm (156) diffusion-models (148) llm-agents (119) vlm (102) video-generation (99) transformer (93) llm-evaluation (89) vision-language (75) long-context (73) benchmark-evaluation (65) code-generation (65) long-horizon (62) retrieval-augmented (58) large-language-models (57) foundation-models (55) benchmarking (54) language-models (54) text-to-image (53) flow-matching (52)