HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-09-04 featured 논문 30편

  1. #1Challenges in Training PINNs: A Loss Landscape Perspective

    PINN의 손실 경관이 학습에 미치는 영향을 분석하고, NysNewton-CG와 Adam+L-BFGS를 통해 학습 성능을 개선한다.

    Pratik Rathore, Weimu Lei, Zachary Frangella, Lu Lu, Madeleine Udell

  2. #2Fact-Checking the Output of Large Language Models via Token-Level Uncertainty Quantification

    대형 언어 모델의 생성물에 포함된 오류를 토큰 수준 불확실성 측정을 통해 탐지하는 새로운 팩트체킹 파이프라인을 제안한다.

    Ekaterina Fadeeva, Aleksandr Rubashevskii, Artem Shelmanov, Sergey Petrakov, Haonan Li

  3. #3ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training

    ZimaBlue는 대규모 영상 데이터를 활용해 일반화 가능한 월드 액션 모델(WAM)을 학습하는 3단계 훈련 프레임워크로, 120,000시간의 영상 학습으로 로봇 성공률을 36.1%에서 77.8%로 향상시킴.

    Xionghao Wu, Yijun Yang, Shiyang Zhou, Haoze Sun, Jianhui Liu

  4. #4GaussianPro: 3D Gaussian Splatting with Progressive Propagation

    GaussianPro는 3DGS의 초기화 문제를 해결하기 위해 MVS 기반의 점진적 전파 전략을 도입한 새로운 3D 가우시안 스플래팅 방법이다.

    Kai Cheng, Xiaoxiao Long, Kaizhi Yang, Yao Yao, Wei Yin

  5. #5Titans: Learning to Memorize at Test Time

    Titans는 2M 이상의 컨텍스트 길이를 처리하면서 정확도를 향상시키는 신경망 장기 기억 모듈 기반의 새로운 아키텍처 패밀리이다.

    Ali Behrouz, Peilin Zhong, V. Mirrokni

  6. #6VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation

    VILA-U는 단일 자동회귀 프레임워크로 시각 이해와 생성을 통합한 멀티모달 모델이다.

    Yecheng Wu, Zhuoyang Zhang, Junyu Chen, Haotian Tang, Dacheng Li

  7. #7OpenCodeInterpreter: Integrating Code Generation with Execution and Refinement

    OpenCodeInterpreter는 실행 및 피드백 기반 반복 개선을 통합한 오픈소스 코드 생성 모델로, GPT-4 Code Interpreter와 유사한 성능을 보인다.

    Tianyu Zheng, Ge Zhang, Tianhao Shen, Xueling Liu, Bill Yuchen Lin

  8. #8SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding

    SafeDecoding은 해킹 공격에 대응하는 안전 인식 디코딩 전략으로, 해악성 토큰 확률을 감소시키고 안전 선언 토큰 확률을 증가시켜 LLM의 안전성을 향상시킨다.

    Zhangchen Xu, Fengqing Jiang, Luyao Niu, Jinyuan Jia, Bill Yuchen Lin

  9. #9Bench2Drive: Towards Multi-Ability Benchmarking of Closed-Loop End-To-End Autonomous Driving

    Bench2Drive는 220개의 다양한 상황을 포함한 150m 길이의 루트를 통해 E2E-AD 시스템의 다중 능력을 평가하는 첫 번째 클로즈드-루프 벤치마크이다.

    Xiaosong Jia, Zhenjie Yang, Qifeng Li, Zhiyuan Zhang, Junchi Yan

  10. #10Boosting Continual Learning of Vision-Language Models via Mixture-of-Experts Adapters

    시각-언어 모델의 지속 학습 성능을 MoE-Adapters와 DDAS를 통해 60% 파라미터 절감과 3.6~7.0% 정확도 향상으로 개선.

    Jiazuo Yu, Yunzhi Zhuge, Lu Zhang, Ping Hu, Dong Wang

  11. #11Learning to Reason under Off-Policy Guidance

    LUFFY는 off-policy 학습을 결합한 RLVR 프레임워크로, 기존 on-policy 제약을 극복하고 수학 벤치마크에서 평균 +6.4 개선을 달성한다.

    Jianhao Yan, Yafu Li, Zican Hu, Zhi Wang, Ganqu Cui

  12. #161ZipTok3D: High-Fidelity 3D Tokenization with Compact Token Prefixes

    ZipTok3D는 극단적으로 짧은 토큰 시퀀스로도 고정밀 3D 재구성을 가능하게 하는 3D 토크나이저로, ShapeNet과 TRELLIS 데이터셋에서 각각 32배와 8배 짧은 토큰 수를 달성했다.

    Mingda Lin, Weijie Wang, Zeyu Zhang, Bowen Cui, Yefei He

  13. #290Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills

    DisCo는 GitHub 리포지토리에서 AI 연구에 필요한 운영 지식을 스킬로 추출해 연구 성능을 134.3%까지 향상시키는 연구 에이전트다.

    Jianlyu Chen, Yuyang Hu, Hongjin Qian, Jiawei Liu, Wenqing Wei

  14. #292Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving

    Qwen-Drive-1.0은 사전 학습된 시각-언어 모델에 3D 인식, 운전 질문 답변, 경로 계획을 통합한 자율 주행용 초거대 기초 모델이다.

    Xin Zhou, Zongchuang Zhao, Zhibo Yang, Mingsheng Li, Humen Zhong

  15. #300Tri-Band Channel Measurement-Enabled Multi-Layer Digital Twin for Terahertz Wireless Data Centers

    THz 대역 무선 데이터센터를 위한 측정 기반 다층 디지털 트윈 프레임워크를 제안한다.

    Mingjie Zhu, Ziming Yu, Guangjian Wang, Chong Han

  16. #306Kirin: Animal Motion Generation from In-the-Wild Video

    Kirin은 자연 상태의 동영상에서 동물 움직임을 생성하는 첫 번째 대규모 데이터셋과 모델을 제시한다.

    Brian Nlong Zhao, Zhuoyang Pan, James M. Rehg, Jiajun Wu, Shangzhe Wu

  17. #307HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?

    HarnessDev는 LLM이 실행 인프라를 생성하고 개선하는 능력을 평가하는 벤치마크로, 생성 및 진화 단계에서 성능과 효율성을 측정한다.

    Yuhao Wu, Jingyuan Zhang, Jiajun Shi, Xinping Lei, Qingshui Gu

  18. #308SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models

    SolarWM은 다양한 데이터와 모델 기반으로 실시간 대화형 영상 생성을 가능하게 하는 오픈 소스 월드 모델 기반 구조를 제시한다.

    Junchao Huang, Guian Fang, Shengju Qian, Xianghao Kong, Zhuoran Zhao

  19. #309Aspire: Can Models Self-Evolve from Vague Goals?

    ASPIRE는 모델이 명확한 목표 없이 모호한 능력 목표로부터 스스로 진화할 수 있는 벤치마크를 제시한다.

    Yuhao Wu, Jingyuan Zhang, Jiajun Shi, Yuxuan Zhang, Xinping Lei

  20. #310AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling

    AgentJudgeBench는 DAG 기반 툴 호출 시스템 평가를 위한 다단계 LLM 판정자 신뢰도 벤치마크로, 3,808개의 인스턴스와 6개의 DAG 구조를 포함한다.

    Abhigya Verma, Amit Kumar Saha, Seganrasan Subramanian, Sai Harshitha Aluru

  21. #311EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction

    EarlyEval은 LLM 에이전트 평가 비용을 절감하기 위해 중간 행동을 기반으로 조기 예측을 수행하는 경량 프레임워크이다.

    Yuling Shi, Zhensu Sun, Junsen Dong, Chengcheng Wan, David Lo

  22. #312Does Imitation Learning Preserve Temporal Robustness in Dexterous Manipulation? An Expert-Learner Comparison Across Task Execution Speeds

    ACT 정책은 전문가와 동일한 성능을 보이지만, 다양한 실행 속도에서의 타임스케일 견고성은 전문가보다 현저히 낮다.

    Clinton Enwerem, John S. Baras, Calin Belta

  23. #313SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers

    SMELT는 계산 예산을 일치시키면서 반복된 중간 레이어를 통해 Transformer 성능을 6.8–18.0% 개선하는 MoE 기반 설계법이다.

    Shaowen Wang, Ge Zhang, Kairong Luo, Yuhao Wu, Shaofan Liu

  24. #314It Takes Two to Match: Co-Evolving Generative Retriever with Reinforcement Learning

    CoGR은 쿼리와 아이템 양쪽에서 키워드를 생성해 매칭하는 생성형 검색 프레임워크로, F₁ 성능을 기존 베이스라인 대비 최대 36.1% 개선한다.

    Runpeng Dai, Kaili Huang, Changsung Kang, Ciya Liao

  25. #315UI-Venus-2 Technical Report

    UI-Venus-2는 모바일, 웹, 데스크톱 환경에서 작동하는 다목적 GUI 에이전트로, 170개 이상의 앱과 강력한 검증 메커니즘을 통해 실용성을 확보한다.

    Venus Team, Zhuohan Cai, Haoxing Chen, Jiaxuan Chen, Weizhi Chen

  26. #316Sim2Signal: Sim-to-Real Benchmarks for Traffic Signal Control

    Sim2Signal은 교차로 신호 제어에서 Sim-to-Real 갭을 체계적으로 평가하기 위한 벤치마크로, 33개 갭 설정과 10개 실제 도시 네트워크에서 18개 완화 방법을 평가한다.

    Ferdous Al Rafi, Susrik Mukherjee, Latika Liladhar Dekate, Jennifer Yawa Lavoe, Huaiyuan Yao

  27. #317Language Models Can Control Their Own Attention

    언어 모델이 자체적으로 주의 영역을 선언하는 Declarative Attention(DA) 프로토콜을 제안하여, KV 캐시 접근을 최소화하고 효율성을 높인다.

    Namgyu Ho, Huzama Ahmad, Woosung Koh, Se-Young Yun, Tal Schuster

  28. #318From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix

    기업 내 200개 이상의 애플리케이션 트래픽을 단일 모델로 통합하여 GPU 자원을 절약하고 성능을 개선한 내부 LLM 포스트 트레이닝 방법론을 제시한다.

    Olga Tsymboi, Dmitrii Stoianov, Ramil Latypov, Danil Taranets, Daniil Dryabin

  29. #319SnapBench: Benchmarking Snap-and-Ask Multimodal Retrieval for Mobile Interactions

    SnapBench는 모바일 환경에서 사진과 질문을 결합한 다중모달 검색의 안정성을 평가하는 최초의 페어형 벤치마크이다.

    Zirong Chen, Fuda Ye, Kuan Zhang, Enjun Du, Junfu Pu

  30. #320Beyond Visual Similarity: Entity-Aligned Retrieval for Knowledge-Based Visual Question Answering

    KBMR은 KB-VQA에서 CLIP 기반 검색의 한계를 극복한 MLLM 기반 검색기로, 최대 14.7%의 Recall@1 개선을 달성했다.

    Hangrui Xu, Zhengxian Wu, Yunyao Yu, Zhuohong Chen, Rui Cong

인기 키워드

reinforcement-learning (331) diffusion-models (190) llm (190) llm-agents (160) video-generation (129) transformer (126) llm-evaluation (125) vision-language (112) vlm (109) long-context (99) large-language-models (94) code-generation (88) long-horizon (86) benchmark-evaluation (82) benchmarking (80) language-models (75) retrieval-augmented (73) flow-matching (68) world-models (68) foundation-models (67)