HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-09-09 featured 논문 30편

  1. #2OmniRe: Omni Urban Scene Reconstruction

    OmniRe는 다양한 동적 객체를 포함한 도시 장면을 고정밀로 재구성하는 시스템으로, 60Hz 실시간 시뮬레이션과 인간 행동 시뮬레이션을 지원한다.

    Ziyu Chen, Jiawei Yang, Jiahui Huang, Riccardo de Lutio, Janick Martinez Esturo

  2. #3RoboSpatial: Teaching Spatial Understanding to 2D and 3D Vision-Language Models for Robotics

    RoboSpatial은 2D 및 3D 시각-언어 모델의 공간 이해 능력을 향상시키기 위해 설계된 대규모 로봇용 데이터셋이다.

    Chan Hee Song, Valts Blukis, Jonathan Tremblay, Stephen Tyree, Yu Su

  3. #4MediQ: Question-Asking LLMs and a Benchmark for Reliable Interactive Clinical Reasoning

    MediQ는 의료 상황에서 신뢰할 수 있는 대화형 추론을 위해 설계된 새로운 벤치마크와 질문 제기 시스템을 제시한다.

    S. Li, Vidhisha Balachandran, Shangbin Feng, Jonathan Ilgen, Emma Pierson

  4. #6TabICL: A Tabular Foundation Model for In-Context Learning on Large Data

    TabICL은 대규모 테이블 데이터 처리를 위한 ICL 기반 탭러블 펀다멘탈 모델로, 500K 샘플 처리가 가능하며 기존 모델 대비 최대 10배 빠르다.

    Jingang Qu, David Holzmüller, G. Varoquaux, Marine Le Morvan

  5. #7PaperBench: Evaluating AI's Ability to Replicate AI Research

    PaperBench는 AI 에이전트가 최신 AI 연구를 복제하는 능력을 평가하는 벤치마크로, 21.0%의 최고 점수를 기록한 Claude 3.5 Sonnet가 인간 기준(41.4%)에는 미치지 못함.

    Giulio Starace, Oliver Jaffe, Dane Sherburn, James Aung, Jun Shern Chan

  6. #8Training Language Models to Reason Efficiently

    LLM의 추론 비용을 줄이기 위해 강화학습을 활용해 사고 과정을 효율적으로 학습하는 방법을 제안한다.

    Daman Arora, Andrea Zanette

  7. #9SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

    SALAD-Bench는 LLM의 안전성, 공격, 방어를 종합적으로 평가하기 위한 계층적 벤치마크로, MD-Judge와 MCQ-Judge 평가자와 함께 제공된다.

    Lijun Li, Bowen Dong, Ruohui Wang, Xuhao Hu, Wangmeng Zuo

  8. #10Actions Speak Louder than Words: Trillion-Parameter Sequential Transducers for Generative Recommendations

    1.5trillion 파라미터를 가진 HSTU 기반 Generative Recommenders가 기존 DLRM 대비 12.4% 성능 향상과 5.3x~15.2x 속도 개선을 달성했다.

    Jiaqi Zhai, Lucy Liao, Xing Liu, Yueming Wang, Rui Li

  9. #11SVD-LLM: Truncation-aware Singular Value Decomposition for Large Language Model Compression

    SVD-LLM은 SVD 기반의 LLM 압축 방법으로, 잘린 특이값과 압축 손실 간의 직접적인 매핑을 보장하는 데이터 화이트닝 기법과 정확도 회복을 위한 순차적 저랭크 근사 기법을 결합하여 높은 압축률에서도 우수한 성능을 보인다.

    Xin Wang, Yu Zheng, Zhongwei Wan, Mi Zhang

  10. #12AgentBoard: An Analytical Evaluation Board of Multi-turn LLM Agents

    AgentBoard는 다단계 대화형 LLM 에이전트를 분석적으로 평가하기 위한 벤치마크 및 오픈소스 평가 프레임워크이다.

    Chang Ma, Junlei Zhang, Zhihao Zhu, Cheng Yang, Yujiu Yang

  11. #304Dr. Claw: An AI Scientist Workspace for Vibe Research

    Dr. Claw는 기존 명령줄 코드 에이전트를 감싸며 연구 과정을 추적 가능하고 복구 가능한 루프로 통합한 오픈소스 연구 워크스페이스이다.

    Dingjie Song, Hanrong Zhang, Dawei Liu, Yixin Liu, Zongxia Li

  12. #305Bilevel Coordinated Reflection: A Game-Theoretic Approach to Multi-Agent LLM Systems

    다중 에이전트 LLM 시스템에서 SRMA 알고리즘을 도입하여 반영 과정을 게임 이론적 구조로 모델링하고, 72.2%의 SWE-bench 성능 달성.

    Yihang Chen, Yuxiang Chen, Yuxuan Huang, Meng Fang, Weilin Luo

  13. #306UniMate: One Unified Model to Animate Diverse Skeletons

    UniMate는 다양한 스켈레톤에 텍스트 프롬프트만으로 움직임을 생성하는 통합 기반 모델로, 테스트 시 최적화 없이도 Zero-shot 전이를 지원한다.

    Linzhan Mou, Jiahui Lei, Zhiyang Dou, Chenyue Cai, Chaoyue Song

  14. #307Unlocking Lossless Speedups in LLMs via Discrete Diffusion

    Uno는 확률 확산을 활용해 대형 언어 모델의 속도를 3배까지 향상시키는 새로운 구조를 제시한다.

    Subham Sekhar Sahoo, Lingjie Chen, Khiem Pham, Jonathan Geuter, Chaitanya Dwivedi

  15. #308Iris: Climbing to the Search Frontier

    Iris-mini와 Iris-pro는 35B-A3B와 397B-A17B 규모로 학습된 검색 에이전트로, SFT-RL climbing을 통해 강력한 성능을 달성했다.

    Ziyuan Liu, Hengqi Liu, Zichuan Wang, Yang Qin, Jiachen Liang

  16. #309Verify Before You Distill: Prompt-Level Teacher Gating for On-Policy Distillation

    TGOPD는 토큰 수준의 지도 신뢰성을 프롬프트 단위로 검증하여 Vanilla OPD를 개선한 새로운 온-정책 디스틸레이션 방법이다.

    Zhiwei Zhang, Zechen Sun, Fei Zhao, Kang Peng, Bin Liang

  17. #310FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience

    FlowBalance는 검증기 기반의 자기 개선을 통해 수학적 추론 성능과 훈련 안정성을 동시에 향상시키는 정규화된 응답 분포 학습 방법이다.

    Zixun Huang, Kishan Panaganti, Haitao Mi, Leowei Liang

  18. #312Motion-Omni: End-to-End Joint Speech and Full-Body Motion for Spoken Dialogue

    Motion-Omni는 대화 중 말과 동작을 동시에 생성하는 엔드투엔드 프레임워크로, 말과 몸짓을 동일한 상태에서 생성하여 실시간 성능과 정확도를 동시에 향상시킨다.

    Chengqian Ma, Wei Tao, Haoyu Zhang, Yiwen Guo

  19. #314The Attention Triangle in Audio-Video Models

    음성-비디오 디퓨전 모델에서 주의 메커니즘의 삼각 구조를 분석하고, 이를 기반으로 의미 누수를 진단 및 완화하는 방법을 제시한다.

    Sagi Polaczek, Noa Kraicer, Gal Metzer, Zhuo Ning, Ali Mahdavi-Amiri

  20. #315Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal

    Qwen3-8B 모델을 대상으로, 정책에 따른 좁은 경계 안전 거부를 학습하는 오프라인 자가 생성 프레임워크를 제시하고, 경계 정확도와 안전성-사용성의 균형을 평가한다.

    Alejo López-Ávila, Iker García-Ferrero, Jezabel Garcia, Antonio Tiene, Román Orús

  21. #318ShallowStream: Index Shallow then Answer Deep for Streaming Video Understanding

    ShallowStream은 MLLM의 얕은 계층을 활용해 실시간 동영상 처리 비용을 52.1배 감소시키는 새로운 스트리밍 비디오 이해 프레임워크이다.

    Jitai Hao, Ke Yang, Qiang Huang, Jun Yu

  22. #319WorldSculpt: Generating Compositional Worlds from Grounded Videos

    WorldSculpt는 Pixal3D를 다중 뷰 조건화 경로로 확장하여 밀집된 장면에서도 개별 객체 메시를 생성하는 3D 합성 프레임워크이다.

    Muyao Niu, Jixuan He, Ruihan Yu, Lian Fu, Yonghao Yu

  23. #320Enoki: Efficient Multi-Level Hallucination Detection

    Enoki는 OpenIE 기반 다중 수준 hallucination 탐지 프레임워크로, claim-level 검증과 span-level 로컬라이제이션을 공유된 표현으로 통합하여 효율성을 높인다.

    Elisei Rykov, Timur Ionov, Nikolay Ivanov, Maksim Savkin, Maksim Makarenko

  24. #322ENEAS: Embedding-guided Neural Ensemble for Adaptive Segmentation

    ENEAS는 텍스트 프롬프트 기반의 인스턴스 추적과 의미적 탐지 문제를 해결하기 위한 신경망 앙상블 모델이다.

    Javier del Pino, Salvador Rodríguez, Alejandro Garabito, Javier Álvarez, Chema Garabito

  25. #323Ask Before You Optimize: Dynamic Pre-Formulation Clarification for Interactive Optimization

    InterOPT은 OR-Clarify 벤치마크를 통해 미완전한 최적화 문제 설명에서 필요한 정보를 선택적으로 명확히 하며, 모델링 전 준비 여부를 판단하는 시스템이다.

    Sihan Ge, Yichen Lin, Chenyu Zhou, Jianghao Lin, Tao Yao

  26. #324Don't Drop Dropout: Optimizing Layer Sparsity for Efficient LLM Training and Inference

    레이어 드롭아웃을 최적화하여 LLM의 학습 및 추론 효율성을 동시에 향상시킨다.

    Mostafa Elhoushi, Alex Pretko, Nolan Dey, Bin Claire Zhang, Gavia Gray

  27. #327Beneath the Surface of Chains-of-Thought: A Mechanistic Interpretation of Reasoning Operations in LLMs

    LLM 내 사고 과정의 내부 기하 구조를 기계적 해석한 연구로, 중간 층에서 사고 연산의 분리도가 가장 높음.

    Seogyeong Jeong, Jaehui Hwang, Dongyoon Han, Geonmo Gu, Alice Oh

  28. #329MaxKernel: Agentic Kernel Generation for TPUs

    MaxKernel은 TPU 커널 최적화를 위한 3가지 에이전트 패러다임을 갖춘 시스템으로, JAXBench에서 1.58× 평균 가속을 달성한다.

    Shangkun Wang, Nina Cai, Charles Hoong, Julian Walker, Gerson Kroiz

  29. #330One Symptom, Three Levers: A Critical Review of On-Policy Self-Distillation

    On-Policy Self-Distillation(자기 교사 정제)은 외부 교사 모델 없이 자기 자신을 교사로 사용하는 학습 방식으로, 수학적 추론에서 성능을 유지하면서 생성 토큰 수를 줄이는 가능성을 제시하지만, 추론 경로의 다양성 감소(콜랩스)라는 주요 문제를 동반한다.

    Justin Robert, Raheel Qader

  30. #331EmbodiedSkills: A Unified Framework for Orchestrating, Training, and Deploying VLA Agents

    EmbodiedSkills는 VLA 정책을 닫힌 루프 에이전트로 변환하는 실행-검증-복구 프레임워크로, RoboTwin 2.0에서 86.20% 성공률을 달성한다.

    Wei Wang, Wenqiao Zhang, Yutong Lin, Yuqian Yuan, Tianwei Lin

인기 키워드

reinforcement-learning (336) diffusion-models (195) llm (195) llm-agents (162) llm-evaluation (133) video-generation (133) transformer (128) vision-language (120) vlm (109) long-context (102) large-language-models (98) code-generation (92) long-horizon (88) benchmark-evaluation (85) benchmarking (82) language-models (77) retrieval-augmented (76) world-models (69) flow-matching (68) foundation-models (67)