HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-08-26 featured 논문 30편

  1. #1WorldMind: Decoupled Game World Model for State-Aware NPC Behavior

    WorldMind는 게임 내 NPC 행동을 게임 상태에 기반한 명시적 결정으로 구현한 최초의 분리형 게임 월드 모델이다.

    Zhiyang Deng, Boran Zhang, Danze Chen, Yeying Jin

  2. #2ToolACE: Winning the Points of LLM Function Calling

    ToolACE는 26,507개의 다양한 API를 기반으로 생성된 정확하고 복잡한 툴 학습 데이터를 통해 8B 파라미터 모델이 GPT-4 수준의 성능을 달성한 자동 생성 파이프라인입니다.

    Weiwen Liu, Xu Huang, Xingshan Zeng, Xinlong Hao, Shuai Yu

  3. #3Bridging Language and Items for Retrieval and Recommendation: Benchmarking LLMs as Semantic Encoders

    BLaIR은 대규모 Amazon Reviews 2023 데이터셋을 기반으로 훈련된 언어-아이템 연관성을 학습하는 추천 시스템용 임베딩 모델로, 복잡한 자연어 문맥에서의 상품 검색 성능을 개선한다.

    Yupeng Hou, Jiacheng Li, Zhankui He, An Yan, Xiusi Chen

  4. #4CodeAgent: Enhancing Code Generation with Tool-Integrated Agent Systems for Real-World Repo-level Coding Challenges

    CodeAgent는 외부 도구를 통합한 LLM 기반 에이전트 프레임워크로, 실무 레포지토리 수준의 코드 생성 성능을 최대 250%까지 향상시킨다.

    Kechi Zhang, Jia Li, Ge Li, Xianjie Shi, Zhi Jin

  5. #5PixArt-Σ: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation

    PixArt-Σ는 4K 해상도 이미지를 생성하는 Diffusion Transformer 모델로, 훈련 효율성과 고해상도 생성 능력을 동시에 달성한 모델이다.

    Junsong Chen, Chongjian Ge, Enze Xie, Yue Wu, Lewei Yao

  6. #6Better & Faster Large Language Models via Multi-token Prediction

    다중 토큰 예측을 통해 13B 모델이 HumanEval에서 12%, MBPP에서 17% 더 많은 문제를 해결하는 LLM 훈련 방법을 제안한다.

    Fabian Gloeckle, Badr Youbi Idrissi, Baptiste Rozière, David Lopez-Paz, Gabriel Synnaeve

  7. #7rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking

    rStar-Math는 MCTS와 자체 진화를 통해 소형 언어 모델의 수학 추론 성능을 OpenAI o1 수준으로 끌어올리는 시스템 2 스타일 접근법이다.

    Xinyu Guan, L. Zhang, Yifei Liu, Ning Shang, Youran Sun

  8. #8To CoT or not to CoT? Chain-of-thought helps mainly on math and symbolic reasoning

    CoT는 수학 및 기호적 추론 태스크에서 성능 향상에 효과적이지만, 다른 태스크에서는 제한적이다.

    Zayne Sprague, Fangcong Yin, Juan Diego Rodriguez, Dongwei Jiang, Manya Wadhwa

  9. #9OminiControl: Minimal and Universal Control for Diffusion Transformer

    OminiControl은 DiT 기반 이미지 생성 모델에 최소한의 파라미터 추가로 유연한 이미지 조건 처리를 가능하게 하는 통합 프레임워크이다.

    Zhenxiong Tan, Songhua Liu, Xingyi Yang, Qiaochu Xue, Xinchao Wang

  10. #10Break the Sequential Dependency of LLM Inference Using Lookahead Decoding

    Lookahead Decoding은 보조 모델 없이 LLM 추론 속도를 1.8x~4x까지 향상시키는 정확한 병렬 디코딩 알고리즘이다.

    Yichao Fu, Peter Bailis, Ion Stoica, Hao Zhang

  11. #11R1-VL: Learning to Reason with Multimodal Large Language Models via Step-Wise Group Relative Policy Optimization

    R1-VL은 StepGRPO를 통해 MLLM의 단계별 추론 능력을 향상시킨 모델로, StepRAR과 StepRVR을 도입해 희소 보상 문제를 해결한다.

    Jingyi Zhang, Jiaxing Huang, Huanjin Yao, Shunyu Liu, Xikun Zhang

  12. #69PhysCaP: Grounding Code-as-Policy Agent with Physics-Informed Exploration

    PhysCaP는 물리 정보 기반 탐색을 도입한 Code-as-Policy 에이전트로, 물체의 질량과 강성 추정을 통해 효율적인 로봇 조작을 가능하게 한다.

    Chen-Yu Lin, Jing-Wen Chen, Hsueh-En Chang, Hung-An Chen, Sheng-Hsun Chang

  13. #107Towards a Densing Law for User Representation Learning at Billion-Scale Capacity

    유저 행동 데이터의 밀도 기반 토큰화 법칙(User Behavioral Densing Law)을 제안하고, ALGN이라는 적응형 토큰화 방법으로 대규모 유저 표현 학습 성능을 향상시킨다.

    Bin Dou, Junru Zhang, Zhaoyi Yuan, Wuliang Huang, Letian Gong

  14. #291ReWorld: An Interactive World Model with Long-Horizon Memory

    ReWorld는 장기 기억과 실시간 제어를 결합한 인터랙티브 월드 모델로, 704×1280 해상도 영상 스트리밍과 11.95° 회전 오차를 기록했다.

    Zhifei Chen, Luozhou Wang, Guibao Shen, Dongyu Yan, Shuai Yang

  15. #299EchoWM: Open and Enterable Omnimodal World Models

    EchoWM은 720p 영상, 환경음, 음악, 음성을 동시 생성하며, 1인칭 및 3인칭 시점의 연속 이동에 반응하는 옴니모달 월드 모델이다.

    Songchun Zhang, Yaowei Li, Junhao Zhuang, Weiyang Jin, Haoyu Wang

  16. #305Retrieval-grounded robot program generation and simulation-based correction via Model Context Protocol

    ABB RAPID 프로그램을 자연어에서 생성하고 RobotStudio 시뮬레이션을 통해 검증하는 RAG-MCP 통합 워크플로우를 제안한다.

    Zhichao Zhou, Siyuan Chen, Omkar Salunkhe, Ebru Turanoglu Bekar, Johan Stahre

  17. #306Composable Trust Infrastructure for Manufacturing Knowledge Graphs: Cross-System Provenance, Temporal Reasoning, and Decision Traceability

    제조 지식 그래프에 SHACL, PROV-O, bi-temporal 버전 관리, 결정 객체를 통합한 신뢰 인프라를 제안한다.

    Grama Chethan

  18. #308One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows

    Thinkingbox는 상태 기반 비즈니스 워크플로우에서 에이전트의 신뢰성 평가를 위한 샌드박스와 벤치마크를 제시한다.

    Zhuochun Li, Youngmin Ko, Ali Keramati, Nicola Ferri, Susana Palmaz Lopez Pelaez

  19. #309Tomatoes, Potatoes, and Onions: Questioning the Need for Faces in Face Presentation Attack Detection

    토마토, 감자, 마늘을 사용한 무표현 얼굴 PAD 데이터셋 TPO를 통해 얼굴 정보 없이도 높은 성능의 PAD가 가능함을 실증.

    Guray Ozgur, Fadi Boutros, Naser Damer

  20. #310MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World Tasks

    MobilePA-Bench는 모바일 환경에서 LLM 에이전트의 도구 사용 및 계획 능력을 종합적으로 평가하는 대규모 벤치마크이다.

    Yi Zhu, Xiongwei Wu, Qiyi Wang, Tingyu Qu, Jiajun Liu

  21. #311Apodex 1.1: Scaling Agentic Intelligence for Complex Work

    Apodex 1.1은 복잡한 작업을 지속적으로 처리하는 에이전트 지능을 확장한 시스템으로, Environment Scaling과 Agentic Coordination Scaling을 통해 성능을 높인다.

    Apodex Team, B. An, B. Li, B. Wang, B. Zhang

  22. #312Industrial-Instruction: An End-to-End Framework for Building Instruction-Tuning and Benchmark Datasets from Industrial Technical Reports

    Industrial-Instruction은 산업 기술 보고서를 기반으로 QA 데이터셋과 생성 파이프라인을 제공하여 산업 벤치마크 및 훈련 데이터를 구축하는 실용적이고 재현 가능한 방법을 제시한다.

    Parsa Bakhtiari, Hassan Bashiri, Alireza Khalilipour, Masoud Nasiripour, Moharram Challenger

  23. #313TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming

    TLive-Omni는 전자상거래 라이브 스트리밍에서 오디오, 비디오, 텍스트, 이미지를 통합한 다중모달 이해를 위한 모델로, Per-vGrid와 Faithful-RFT를 통해 실시간 성능과 정확도를 동시에 달성한다.

    Yibo Hu, Yu Qian, Mao Gu, Yingfan Tao, Yuhao Chen

  24. #314Unlocking the Potential of Image Editing via Concept Scaling and Dense Supervision

    이미지 편집 모델의 성능을 향상시키기 위해 개념 세분화와 밀집된 지도 학습 전략을 제안하며, ConceptEdit-12M 데이터셋과 ConceptEdit-Bench 평가 도구를 제시한다.

    Long Cui, Xiaoqian Liu, Qi Qin, Yi Xin, Tao Lin

  25. #315Graph Engineering in the Era of LLM Agents: From Individual Intelligence to System Intelligence

    LLM 에이전트 시스템의 복잡성을 관리하기 위해 그래프 기반 구조를 도입한 System Intelligence와 Graph Engineering 패러다임을 제시한다.

    Yuyuan Feng, Zhishang Xiang, Chaobin Yang, Qichao Ma, Zerui Chen

  26. #316Hydra-0: Action Flow for Generalist World Modeling and Control

    Hydra-0는 로봇 동작을 픽셀 운동으로 표현하는 Action Flow를 기반으로, 다양한 로봇과 환경에서 일반적인 월드 모델링과 제어를 실현한 시스템이다.

    Hongyu Li, Bowen Wen, Xinghao Zhu, Yixuan Wang, Yilun Du

  27. #317Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts

    대규모 MoE 모델의 학습률 최적화를 위해 계산 효율적인 2단계 하이퍼파라미터 전이 프레임워크를 제안한다.

    Nayeon Kim, Hojin Lee, Yunju Bak, Jaesun Park, Boseop Kim

  28. #318Prime Agent: A Self-Improving RLM Harness

    Prime Agent는 장기적 작업을 위한 RLM 기반 오픈소스 에이전트 허브로, ARC-AGI-3 성능을 30%에서 95.5%까지 향상시킨다.

    Seth Karten, Alex L. Zhang, Kevin Thomas, Sebastian Müller, Elie Bakouch

  29. #319ParaTempo: Efficient Parallel Reasoning via Temporal Confidence

    ParaTempo는 시간적 신뢰도를 기반으로 병렬 추론 과정을 효율적으로 제어하여, 수학 및 과학적 추론에서 21.8–32.2%의 지연 감소와 18.1–30.3%의 토큰 사용 감소를 달성한 비학습형 비동기 프레임워크이다.

    Xuteng Zhang, Wenhao Zeng, Xiaodong Gu, Chao Hu, Haotian Lin

  30. #320OmniAssistBench: Assistant-style Interaction Benchmark for Omni-LLMs

    OmniAssistBench는 실시간 비디오 어시스턴트로 활용되는 Omni-LLMs의 상호작용 능력을 평가하기 위한 새로운 벤치마크로, 기존 모델들의 시각적 지시, 장기 기억, 지연 응답 등에서 한계를 드러냈다.

    Xianyun Sun, Chaoyou Fu, Zhengye Zhang, Feiyang Duan, Qingyuan Cao

인기 키워드

reinforcement-learning (331) diffusion-models (190) llm (190) llm-agents (160) video-generation (129) transformer (126) llm-evaluation (125) vision-language (112) vlm (109) long-context (99) large-language-models (94) code-generation (88) long-horizon (86) benchmark-evaluation (82) benchmarking (80) language-models (75) retrieval-augmented (73) flow-matching (68) world-models (68) foundation-models (67)