HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-09-24 featured 논문 30편

  1. #1Enhancing End-to-End Autonomous Driving with Latent World Model

    LAW(Latent World Model)를 활용한 자기감독 학습이 nuScenes, NAVSIM, CARLA에서 최고 성능을 달성한다.

    Yingyan Li, Lue Fan, Jiawei He, Yu-Quan Wang, Yuntao Chen

  2. #2Multi-Term Fourier Graph Neural Network with Sample Relationship Learning for Enhanced Remaining Useful Life Prediction

    MTFGN-SRL은 RUL 예측에서 정확도와 안정성을 향상시키기 위해 다중 윈도우와 샘플 관계 학습을 결합한 새로운 그래프 신경망 프레임워크이다.

    Ya Song, Laurens Bliek, Yaoxin Wu, Yingqian Zhang

  3. #3ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning

    ZebraLogic은 LLM의 논리적 추론 능력과 확장성을 평가하기 위한 제어 가능한 퍼즐 기반 벤치마크로, 복잡도 증가에 따른 성능 저하 현상을 밝혀낸다.

    Bill Yuchen Lin, Ronan Le Bras, Kyle Richardson, Ashish Sabharwal, Radha Poovendran

  4. #4OpenMoE: An Early Effort on Open Mixture-of-Experts Language Models

    OpenMoE는 650M~34B 파라미터 규모의 오픈소스 MoE 언어 모델로, 라우팅 메커니즘 분석과 개선 전략 제시를 통해 MoE 연구를 촉진한다.

    Fuzhao Xue, Zian Andy Zheng, Yao Fu, Jinjie Ni, Zangwei Zheng

  5. #5MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding

    MMBench-Video는 장시간 영상과 다양한 능력을 기반으로 LVLM의 비디오 이해력을 체계적으로 평가하는 새로운 벤치마크이다.

    Xinyu Fang, Kangrui Mao, Haodong Duan, Xiangyu Zhao, Yining Li

  6. #6Mixture of LoRA Experts

    Mixture of LoRA Experts(MoLE)는 다중 LoRA의 유연하고 효율적인 조합을 위해 계층적 게이팅 함수를 도입한 새로운 LoRA 퓨전 기법이다.

    Xun Wu, Shaohan Huang, Furu Wei

  7. #7Ovis-Embedding: Pushing the Frontiers of Universal Omni-Modal Embeddings

    Ovis-Embedding은 텍스트, 이미지, 영상, 오디오를 통합한 공통 임베딩 공간을 생성하는 최신 옴니모달 임베딩 모델이다.

    Ovis-Embedding Team

  8. #8CoT-Valve: Length-Compressible Chain-of-Thought Tuning

    CoT-Valve는 단일 모델로 사고 과정의 길이를 동적으로 조절하여 추론 비용을 줄이는 새로운 튜닝 전략이다.

    Xinyin Ma, Guangnian Wan, Runpeng Yu, Gongfan Fang, Xinchao Wang

  9. #9Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts

    Rainbow Teaming은 LLM의 안전성을 진단하고 향상시키기 위해 품질-다양성 검색을 기반으로 한 적대적 프롬프트를 자동 생성하는 새로운 블랙박스 접근법이다.

    Mikayel Samvelyan, S. Raparthy, Andrei Lupu, Eric Hambro, Aram H. Markosyan

  10. #10A Sanity Check for AI-generated Image Detection

    AI 생성 이미지 탐지의 한계를 점검하고, 새로운 데이터셋과 모델 AIDE를 제안하여 성능을 개선한다.

    Shilin Yan, Ouxiang Li, Jiayin Cai, Yanbin Hao, Xiaolong Jiang

  11. #11Do Large Language Models Latently Perform Multi-Hop Reasoning?

    대규모 언어 모델(LLM)이 다중 점프 추론을 잠재적으로 수행하는지 실험적으로 분석하고, TwoHopFact 데이터셋과 내부 추론 경로를 측정하는 새로운 지표를 제안한다.

    Sohee Yang, E. Gribovskaya, Nora Kassner, Mor Geva, Sebastian Riedel

  12. #12Orion: A Holistic End-To-End Autonomous Driving Framework by Vision-Language Instructed Action Generation

    ORION은 QT-Former, LLM, 생성형 플래너를 결합해 Bench2Drive에서 77.74 DS, 54.62% SR을 달성한 종단간 자율주행 프레임워크이다.

    Haoyu Fu, Diankun Zhang, Zongchuang Zhao, Jianfeng Cui, Dingkang Liang

  13. #282Grounded Action Model: 3D Grounding as a Foundation for Robotics

    GAM은 3D 객체 정착 기반의 새로운 로봇 기초 모델로, RoboTwin 2.0에서 55.3% 성공률을 달성한다.

  14. #287Embedding Physics Priors in Robot Learning: A Survey

    로봇 학습에 물리학 사전지식을 통합하는 방법을 체계적으로 분류하고, 주요 응용 분야와 개방적 문제를 조망한 서베이 논문.

    Mattia Piccinini, Lucas Schulze, Alice Plebe, Matteo Saveriano, Thomas Beckers

  15. #305Lean Pool: An AI-Maintained Archive of Formalized Mathematics

    Lean Pool은 AI 에이전트가 관리하는 형식화 수학 아카이브 시스템이다.

    Vasily Ilin

  16. #306Realtime-Venus: A full-duplex interaction system with asynchronous delegation

    Realtime-Venus는 비동기적 위임을 지원하는 프로액티브 풀-더플렉스 대화 시스템으로, 9B 규모의 두 모델을 통해 영상 및 음성 대화 성능을 개선한다.

    Venus Team, Ant Group

  17. #307OmniEdu: Open Foundation Models for Learning and Teaching

    OmniEdu는 K-12 교육과 학습을 위한 4가지 핵심 능력 기반의 오픈 소스 펀더멘탈 모델로, 27B 모델이 K12-Bench에서 63.12% EM, 76.69% F1 성능을 달성한다.

  18. #308GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay

    GameHorizon Suite는 다양한 시간 범위와 모델 가족에서 게임플레이 능력을 평가하는 통합 데이터 및 평가 툴로, 21개 AAA 게임에서 5,000시간의 데이터를 기반으로 47개 모델을 평가한다.

  19. #309The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks

    Taste-Bench라는 새로운 벤치마크를 제안하여 LLM 에이전트의 장기적 판단력(‘taste’)을 측정하고 훈련한다.

    Wenbo Pan, Zhichao Liu, Shujie Liu, Jingying Zeng, Chin-Yew Lin

  20. #310CARE: Experience-Guided Atomic Corrective Execution for Vision-Language-Action Policies

    CARE는 실패 경험을 학습하여 시각-언어-작업 정책의 회복력을 향상시키는 프레임워크로, 실제 세계에서 15.9%의 성공률 향상을 보인다.

  21. #311JEV-as-a-Judge: Accept When Confident, Escalate When Unsure

    JEV-as-a-Judge는 저비용으로 신뢰도 높은 판단을 제공하며, 불확실한 경우에만 강력한 모델로 전달하는 방식으로 99%의 정확도를 유지한다.

    Yubo Li, Yidi Miao, Ramayya Krishnan, Rema Padman

  22. #3121% of Tokens Can Be Enough: On Gradient Estimation in On-Policy Distillation

    1% 미만의 토큰으로도 성능 유지 가능: 정보 효율성 비율(IER) 기반 토큰 선택을 통한 온-정책 디스틸레이션 연구.

  23. #313RULER: Instance-aware Rubric Rewards for SVG Generation

    RULER은 자연어 지시에 기반한 SVG 생성에서 인스턴스별 루브릭 기반 보상으로 생성 품질을 0.432 → 0.693 수준으로 향상시킨다.

    Hangyu Ran, Yuhao Zheng, Yingying Zhang, Kevin Qinghong Lin, Han Peng

  24. #314ACLArena: Agent Continue Learning in Multi-stage Post-training

    ACLArena는 다단계 포스트 트레이닝 환경에서 에이전트의 지속 학습을 체계적으로 분석하고 개선하는 프레임워크이다.

    Haixin Wang, Xiaoxuan Wang, Junkai Zhang, Han Zhang, Renliang Sun

  25. #315Do Synthetic Personas Predict Real Audience Response? A Sim-to-Real Study Where a No-Persona Baseline Beats Persona-Based Copy Simulation

    Upworthy A/B 테스트 데이터를 기반으로, 인공 인물(persona)을 사용한 마케팅 콘텐츠 시뮬레이션은 예측 정확도가 낮아, 단순 LLM 기반 순위 매기기가 더 효과적임을 밝힘.

    Alexandre Cristovão Maiorano

  26. #316Topological Signal Processing With Unoriented Operators

    무향 토폴로지 신호 처리(UTSP)는 유향 경계 연산자를 대체해 무향 인접 행렬을 사용해 고차원 신호의 구조를 분석하고, 신호 복원 성능을 향상시킨다.

    Andrea Cavallo, Varun Sarathchandran, Geert Leus, Elvin Isufi

  27. #317Document Retrieval-Aware Chunking (D-RAC): Universal Retrieval-Aware Ingestion of Enterprise Documents via PDF Normalization and Multimodal Markdown Conversion

    D-RAC은 PDF 정규화와 멀티모달 마크다운 변환을 통해 기업 문서의 효율적이고 확장 가능한 검색 최적화 청크 생성을 실현한 시스템이다.

  28. #318VideoGen-Agent: Reinforcing Video Generation Agents

    VideoGen-Agent는 다중 작업 강화 학습을 통해 외부 도구를 활용하는 영상 생성 에이전트로, VABench 벤치마크에서 기존 모델 대비 19.1점 개선된 성능을 보인다.

  29. #319Recursive self-improvement of AI research agents

    AIDE²는 AI 연구 에이전트가 자체 연구 효율을 반복적으로 개선하는 시스템으로, 8일간 7개의 개선을 발견하고 FML-Bench 기준 인간 설계 에이전트와 유사한 성능을 보였다.

    Dhruv Srikanth, Bingchen Zhao, Dixing Xu, Yuxiang Wu, Zhengyao Jiang

  30. #320GAE: Learning a Geometry-Native Latent Space for 3D-Consistent World Generation

    GAE는 3D 일관성 있는 세계 생성을 위한 기하학적 인코딩을 갖춘 압축된 잠재 공간을 학습하여 생성 및 인식 간의 공유 인터페이스를 제시한다.

    Jiahao Lu, Minghao Yin, Wenbo Hu, Hengyu Liu, Wang Zhao

인기 키워드

reinforcement-learning (371) diffusion-models (214) llm (212) llm-agents (171) llm-evaluation (147) video-generation (147) transformer (139) vision-language (135) large-language-models (118) long-context (113) vlm (110) code-generation (102) long-horizon (98) benchmark-evaluation (97) benchmarking (90) language-models (90) retrieval-augmented (80) foundation-models (79) world-models (74) flow-matching (72)