HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-08-04 featured 논문 30편

  1. #1Scaling Large-Language-Model-based Multi-Agent Collaboration

    MacNet을 통해 1,000개 이상의 대형 언어 모델 기반 에이전트가 협력하는 구조와 성능을 분석하고, 협력적 스케일링 법칙을 제시한다.

    Cheng Qian, Zihao Xie, Yifei Wang, Wei Liu, Yufan Dang

  2. #2FoundationStereo: Zero-Shot Stereo Matching

    FoundationStereo는 제로샷 제너럴라이제이션을 달성한 대규모 스테레오 깊이 추정 기초 모델로, 1M쌍의 합성 데이터와 Side-Tuning Adapter, AHCF 모듈을 통해 실내외 데이터셋에서 뛰어난 성능을 보인다.

    Bowen Wen, Matthew Trepte, J. Aribido, Jan Kautz, O. Gallo

  3. #4Feature Interaction Modeling for Physics-Informed Neural Networks and Neural Operators

    Quan Gu, Hongxia Liu

  4. #5Structured 3D Latents for Scalable and Versatile 3D Generation

    SLat 기반 3D 생성 모델 Trellis는 500K 개의 3D 자산으로 학습되어 높은 품질의 3D 생성과 편집을 지원한다.

    Jianfeng Xiang, Zelong Lv, Sicheng Xu, Yu Deng, Ruicheng Wang

  5. #6MambaIR: A Simple Baseline for Image Restoration with State-Space Model

    MambaIR은 이미지 복원에서 Mamba 기반 모델의 국부적 퍼픽스 유사성과 채널 상호작용을 강화하여 기존 CNN 및 Transformer 대비 뛰어난 성능을 보인다.

    Hang Guo, Jinmin Li, Tao Dai, Zhihao Ouyang, Xudong Ren

  6. #7SnapKV: LLM Knows What You are Looking for Before Generation

    SnapKV는 KV 캐시 압축을 통해 LLM의 메모리 효율과 생성 속도를 향상시키는 fine-tuning-free 방법이다.

    Yuhong Li, Yingbing Huang, Bowen Yang, Bharat Venkitesh, Acyr F. Locatelli

  7. #8Simple and Effective Masked Diffusion Language Models

    마스킹된 디퓨전 언어 모델(MDLM)이 기존 AR 모델과 유사한 성능을 보인다.

    S. Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin

  8. #9Show-o: One Single Transformer to Unify Multimodal Understanding and Generation

    Show-o는 단일 트랜스포머로 멀티모달 이해와 생성을 통합한 모델로, 자동회귀와 확산 모델링을 결합하여 다양한 비전-언어 작업을 처리한다.

    Jinheng Xie, Weijia Mao, Zechen Bai, David Junhao Zhang, Weihao Wang

  9. #10TimeMixer: Decomposable Multiscale Mixing for Time Series Forecasting

    TimeMixer는 다중 스케일 분해와 혼합을 통해 시계열 예측 성능을 향상시키는 MLP 기반 모델이다.

    Shiyu Wang, Haixu Wu, X. Shi, Tengge Hu, Huakun Luo

  10. #11OLMo: Accelerating the Science of Language Models

    OLMo는 훈련 데이터와 코드를 포함한 완전한 오픈 소스 언어 모델로, LLaMA-7B 대비 유사한 성능을 보인다.

    Dirk Groeneveld, Iz Beltagy, Pete Walsh, Akshita Bhagia, Rodney Kinney

  11. #12MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?

    MathVerse는 MLLMs가 수학 문제의 다중 모달 정보를 얼마나 정확히 해석하는지를 평가하기 위한 새로운 수학 시각적 벤치마크이다.

    Renrui Zhang, Dongzhi Jiang, Yichi Zhang, Haokun Lin, Ziyu Guo

  12. #125N_0-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation

    NeoteAI Team, Fudan TEAI Team

  13. #176QQWorld: Quantile-Quantile Matching for World Model Regularization

    Zhoushun Yu, Xiaoyu Hu, Xiangyu Xu

  14. #306Mental World Modeling

    Hao Fei, Yiran Zhao

  15. #307N_0-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens

    NeoteAI Team, Fudan TEAI Team

  16. #309From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement

    Qinsi Wang, Jing Shi, Huazheng Wang, Kun Wan, Yiran Wu

  17. #313ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow

    ODEWorld는 물리 시간 기반 ODE 속도장을 학습하는 PT-Flow를 기반으로 한 연속형 세계 모델로, 장기 예측과 정밀한 이미지 재구성을 가능하게 한다.

    Dongxiu Liu, Haoyi Niu, Peng Cheng, Yuan Gao, Xirui Kang

  18. #314Meshy T2: Fast Native Mesh Generation with Flow Matching

    Jiale Xu, Rendong Liang, Yuhao Long, Siyuan Shen, Zangyueyang Xian

  19. #317AISPA: User-Centric System Prompt Auditing for Large Language Model Applications

    Xiangning Lin, Shenzhe Zhu, Shu Yang, Zhenyu Zhang, Haoqian Zhang

  20. #318EMBL AI Librarian: Life-Sciences Knowledge Layer for AI Agents

    Luigi Sigillo, Matteo Silvestri, Francesco Tabaro, Rajat Bhatnagar, Syed Irtaza Mubashar

  21. #320Scaling Properties of Text Conditioning in Visual Generation

    Zilong Chen, Chaorui Deng, Kunchang Li, Hongyi Yuan, Haoqi Fan

  22. #322SAF-OPD: Stable Advantage Fusion for On-Policy Distillation

    SAF-OPD는 RLVR과 OPD의 결합 시 발생하는 신호 불균형 문제를 해결해 정확도를 0.51–2.70% 개선한다.

    Yifan Ding, Xincheng Wei, Yoshua Y. Li, Ziheng Li, Yuquan Lu

  23. #323β-OPSD: Deriving with Policy Optimization, Training with Self-Distillation

    β-OPSD는 정책 최적화 기반의 자가 교사 학습(SEL)을 효율적으로 근사하는 새로운 자가 교사 학습 알고리즘으로, 수학적 추론 성능을 향상시킨다.

    Jiawei Xu, Minghui Liu, Juzheng Zhang, Tom Goldstein, Furong Huang

  24. #324Fewer Clarifications, Better Code: Benchmarking Cross-Session Personalized Ambiguity Adaptation in Coding Assistants

    Zijian Xu, Wenshuo Zhang, Zisen Qin, Rui Sheng, Yushi Sun

  25. #326Can Large Language Models Execute Parent Orders?

    LLM 기반 PACE 프레임워크가 주문 실행 비용을 0.65 bps 개선하며 인간 투자자와 다른 행동 패턴을 보인다.

    Zane Shen, Xinli Xu, Guangyi Zhang, Jialong Chen, Jinsong Zhou

  26. #327Enhancing Rubric-based RL via Self-Distillation

    Mingxuan Xia, Yuhang Yang, Chao Ye, Shuai Zhu, Shenzhi Yang

  27. #328ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction

    Boyang Zhang, Adrian Lyjak, Eli Stewart, Zhaoqi Li, Simon Suo

  28. #329INTACT: Isomorphic Intent-to-Action Learning for Search-Free World Models

    INTACT는 액션-라벨이 있는 트레이젝토리로부터 검색 없이 목표에 도달하는 인텐트-액션 매핑을 학습하는 엔드투엔드 JEPA 모델이다.

    Junhan Sun, Hao Zhao, Guofeng Zhang

  29. #330Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation

    Explorative Modeling(XM)은 생성 모델의 학습 루프를 탐색하여 모드를 명확히 포착하고, 기존 생성 모델의 성능과 end-to-end 생성을 동시에 향상시킨다.

    Alexi Gladstone, Heng Ji, Yilun Du

  30. #331Evaluation-Verification Reward for Consistent Multi-Reference Image Editing

    Yingmao Miao, Pengfei Zhang, Xiaochen Lv, Meng Yu, Lei Sun

인기 키워드

reinforcement-learning (279) llm (160) diffusion-models (151) llm-agents (122) vlm (103) video-generation (101) llm-evaluation (95) transformer (95) vision-language (82) long-context (75) code-generation (67) benchmark-evaluation (66) long-horizon (62) large-language-models (59) retrieval-augmented (58) foundation-models (56) language-models (56) benchmarking (55) text-to-image (54) flow-matching (53)