HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-09-03 featured 논문 30편

  1. #1Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving

    Qwen-Drive-1.0은 사전 학습된 시각-언어 모델에 3D 인식, 운전 질문 답변, 경로 계획을 통합한 자율 주행용 초거대 기초 모델이다.

    Xin Zhou, Zongchuang Zhao, Zhibo Yang, Mingsheng Li, Humen Zhong

  2. #2ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training

    ZimaBlue는 대규모 영상 데이터를 활용해 일반화 가능한 월드 액션 모델(WAM)을 학습하는 3단계 훈련 프레임워크로, 120,000시간의 영상 학습으로 로봇 성공률을 36.1%에서 77.8%로 향상시킴.

    Xionghao Wu, Yijun Yang, Shiyang Zhou, Haoze Sun, Jianhui Liu

  3. #3UI-Venus-2 Technical Report

    UI-Venus-2는 모바일, 웹, 데스크톱 환경에서 작동하는 다목적 GUI 에이전트로, 170개 이상의 앱과 강력한 검증 메커니즘을 통해 실용성을 확보한다.

    Venus Team, Zhuohan Cai, Haoxing Chen, Jiaxuan Chen, Weizhi Chen

  4. #4CityGaussian: Real-time High-quality Large-Scale Scene Rendering with Gaussians

    CityGaussian(CityGS)는 대규모 3D 장면의 실시간 렌더링을 위해 분할-정복 및 LoD 전략을 도입한 3D Gaussian Splatting 기반 방법이다.

    Yang Liu, He Guan, Chuanchen Luo, Lue Fan, Junran Peng

  5. #5EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time Test

    EAGLE-3는 훈련 시 테스트 기법을 도입해 LLM 추론 속도를 최대 6.5배까지 향상시키는 새로운 추론 가속화 방법이다.

    Yuhui Li, Fangyun Wei, Chao Zhang, Hongyang Zhang

  6. #6Reinforcement Learning for Reasoning in Large Language Models with One Training Example

    1-shot RLVR을 통해 단 1개의 예시로 LLM의 수학적 추론 성능을 36.0%에서 73.6%까지 향상시킬 수 있음을 보인다.

    Yiping Wang, Qing Yang, Zhiyuan Zeng, Liliang Ren, Lucas Liu

  7. #7MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

    MT-Bench-101은 13개의 다차례 대화 태스크를 기반으로 LLM의 세부 대화 능력을 평가하는 새로운 벤치마크이다.

    Ge Bai, Jie Liu, Xingyuan Bu, Yancheng He, Jiaheng Liu

  8. #8Mini-Splatting: Representing Scenes with a Constrained Number of Gaussians

    Mini-Splatting은 제한된 수의 가우시안으로 장면을 표현하는 문제를 해결하기 위한 밀도 증가 및 단순화 알고리즘을 제안한다.

    Guangchi Fang, Bing Wang

  9. #9Debating with More Persuasive LLMs Leads to More Truthful Answers

    더 설득력 있는 LLM이 토론을 통해 비전문가가 더 정확한 답을 선택하도록 돕는다.

    Akbir Khan, John Hughes, Dan Valentine, L. Ruis, Kshitij Sachan

  10. #10Chain-of-Thought Reasoning Without Prompting

    LLM이 프롬프트 없이 사고 과정을 생성할 수 있음을 보여주는 새로운 디코딩 기법 제시.

    Xuezhi Wang, Denny Zhou

  11. #11DEIM: DETR with Improved Matching for Fast Convergence

    DEIM은 DETR 기반 실시간 객체 탐지 모델의 수렴 속도를 빠르게 하기 위해 Dense O2O 매칭과 Matchability-Aware Loss(MAL)를 결합한 훈련 프레임워크이다.

    Shihua Huang, Zhichao Lu, Xiaodong Cun, Yongjun Yu, X. Zhou

  12. #12HippoRAG: Neurobiologically Inspired Long-Term Memory for Large Language Models

    HippoRAG는 인간의 해마 기반 기억 이론을 모방하여 LLM의 지식 통합을 향상시키는 새로운 RAG 프레임워크로, MuSiQue와 2WikiMultiHopQA에서 최대 20% 개선된 성능을 보인다.

    Bernal Jimenez Gutierrez, Yiheng Shu, Yu Gu, Michihiro Yasunaga, Yu Su

  13. #13MobileLLM: Optimizing Sub-billion Parameter Language Models for On-Device Use Cases

    MobileLLM은 10억 미만 파라미터 모델에서 모델 아키텍처 최적화를 통해 모바일 기기에서의 성능을 획기적으로 향상시킨다.

    Zechun Liu, Changsheng Zhao, Forrest N. Iandola, Chen Lai, Yuandong Tian

  14. #171Safin-1: Safety from Within through Memory-Native State Evolution

    Safin-1은 내재적 안전성을 구현하기 위해 메모리 기반 상태 진화와 라우팅을 결합한 기초 모델로, Safety from Within 원칙을 구현한다.

    Ming Zhang, Kaisen Yang, Shu Yu, Ermo Hua, Zhekai Chen

  15. #291StudentSim: Training LLM-based Student Simulators

    StudentSim은 희소한 학습자 데이터를 기반으로 개인화된 학습자 시뮬레이터를 생성하는 프레임워크로, 기존 방법 대비 높은 정확도와 지도 반응성을 보인다.

    Ke Yang, Chenglong Wang, Michel Galley, Chandan Singh, Jeevana Priya Inala

  16. #306H3-World: Turning Language Understanding into World Control

    H3-World는 MiniMax-H3를 기반으로 언어 인터페이스를 통해 정밀한 월드 컨트롤을 구현하는 효율적인 프레임워크이다.

    Danze Chen, Zeqing Wang, Ziyue Lin, Xingyi Yang, Yeying Jin

  17. #307WebWorld: The Browser as a World Model for Self-Improving Web Code

    WebWorld는 브라우저를 월드 모델로 활용해 VLM 기반 웹 코드 자기 개선의 신뢰성을 높이는 인터페이스를 제시한다.

    Jiajun Wu, Jian Yang, Yaxin Du, Wei Zhang, Haowen Wang

  18. #308DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution

    DreamX-Creator 1.0은 7B 규모의 생성기와 2K 리파이너를 통해 고해상도 동영상과 오디오를 연동 생성하는 오픈 소스 시스템이다.

    Jiashu Zhu, Yanhao Zheng, Ruitian Tian, Rujing Dang, Shen Zhang

  19. #309SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers

    SMELT는 계산 예산을 일치시키면서 반복된 중간 레이어를 통해 Transformer 성능을 6.8–18.0% 개선하는 MoE 기반 설계법이다.

    Shaowen Wang, Ge Zhang, Kairong Luo, Yuhao Wu, Shaofan Liu

  20. #310IMPACT: Attention Is the Interaction Map for Scalable Interaction-Aware World Model Training

    IMPACT는 외부 표현 없이 주의력 기반 상호작용 지도를 통해 세계 모델의 상호작용 생성을 향상시키는 확장 가능한 훈련 프레임워크이다.

    Rongze Tang, Jianjie Fang, Zhaolu Wang, Ziyou Wang, Xvyuan Liu

  21. #311Normalized Low-Rank Adaptation

    NoRA는 LoRA의 down-projection 행렬을 정규화하여 학습 안정성과 성능을 향상시키는 간단한 방법이다.

    Jiale Kang, Ziyin Yue, Zheng Zhan, Yangyi Huang, Weiyang Liu

  22. #312Recursive Criticality of AI Self-Improvement

    AI 연구 생산성과 피드백 강도를 비교하는 재귀 재생산 수치 $\mathcal{R}_{\mathrm{AI}}$를 도출하여 AI 자기 개선의 자기 증폭 조건을 분석한다.

    Mikhail Burtsev

  23. #313InternReviewer & InternAdvocate: Objective Reward and Evaluation for Agentic Reinforcement Learning in Peer Review and Rebuttal

    InternReviewer와 InternAdvocate는 강화학습 기반의 학술 리뷰 및 반박 생성 에이전트로, 객관적 보상 설계와 실시간 검증을 통해 신뢰성과 정확도를 향상시킨다.

    Xuerui Su, Liya Guo, Qizhi Pei, Qipeng Guo, Zhongbo Tian

  24. #314From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix

    기업 내 200개 이상의 애플리케이션 트래픽을 단일 모델로 통합하여 GPU 자원을 절약하고 성능을 개선한 내부 LLM 포스트 트레이닝 방법론을 제시한다.

    Olga Tsymboi, Dmitrii Stoianov, Ramil Latypov, Danil Taranets, Daniil Dryabin

  25. #315SHAPE of Chain-of-Thought in Math Reasoning

    SHAPE는 수학적 추론의 사고 흐름을 해석하기 위한 이론적 프레임워크로, 히ュ리스틱과 의미 공간을 분석하여 LLM의 추론 패턴을 진단하고 정확도를 향상시킨다.

    Jonghyun Song, Sangjun Song, Minjae Oh, Haesung Pyun, Sungsik Lee

  26. #316LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation

    LightNav-0는 사전 학습된 VLM의 공간 지능을 활용한 일반적 이형 탐색 모델로, 10개 시뮬레이션 환경에서 최고 성능을 보인다.

    Shaoan Wang, Aocheng Luo, Fei Huang, Jingyi Xu, Xiaoyang Wang

  27. #317Super Library Agent: Joint Generation and Maintenance of Multiple Applications Beyond the Single Codebase

    Super Library Agent는 다중 애플리케이션 개발 시 공유 로직을 중복하지 않고 유지보수성을 향상시키는 LLM 기반 코드 생성 방법이다.

    Daegyu Sung, Yukyeong Lee, Geon Park, Yumin Choi, Sung Ju Hwang

  28. #318Evaluating the Hidden Costs of Personalization in Large Language Models

    LLM 개인화는 유저 만족도를 높이지만, 무관한 정보 참조, 선호도 축소, 과도한 동의 편향을 유발하며, 이를 평가하기 위한 PRISK 프레임워크를 제안하고 13개 모델에서 평균 45.9% 이상의 편향 증가를 확인했다.

    Yumeng Wang, Yuchen Wu, Cheng Qian, Zhiyuan Fan, Hyeonjeong Ha

  29. #319Hi-Q: Hierarchical Evidence-guided Query Refinement for Multi-Hop Question Answering

    Hi-Q는 다중 점프 질문 답변에서 증거 기반으로 쿼리 단위의 가독성 여부를 판단하여 계층적 쿼리 정제를 수행하는 새로운 RAG 프레임워크이다.

    Jueun Kim, Sungho Park, Wook-Shin Han

  30. #320Chat-Edit-3D++: Interactive 3D and 4D Scene Editing via Large Language Models

    CE3D++는 대규모 언어 모델을 기반으로 사용자의 임의 텍스트 입력을 해석해 3D/4D 장면 편집을 가능하게 하는 대화형 편집 프레임워크이다.

    Shuangkang Fang, Yufeng Wang, Yi-Hsuan Tsai, Wenrui Ding, Yi Yang

인기 키워드

reinforcement-learning (331) diffusion-models (190) llm (190) llm-agents (160) video-generation (129) transformer (126) llm-evaluation (125) vision-language (112) vlm (109) long-context (99) large-language-models (94) code-generation (88) long-horizon (86) benchmark-evaluation (82) benchmarking (80) language-models (75) retrieval-augmented (73) flow-matching (68) world-models (68) foundation-models (67)