HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-09-30 featured 논문 30편

  1. #1General-Reasoner: Advancing LLM Reasoning Across All Domains

    General-Reasoner는 수학 외 다양한 분야에서 LLM의 추론 능력을 향상시키는 새로운 훈련 패러다임이다.

    Xueguang Ma, Qian Liu, Dongfu Jiang, Ge Zhang, Zejun Ma

  2. #2When Does Domain Adaptation Help on Physical Vibration Sensors? A Held-Out-Bearing Study of Neural-Operator and Convolutional Models

    회전 속도 변화에 따른 베어링 고장 진단에서 입력 표현이 도메인 적응 성능에 결정적 영향을 미친다는 것을 Fourier Neural Operator와 CNN 비교를 통해 입증.

    Kumbha Nagaswetha, Rabi Pathak

  3. #3Recursive Harness Distillation across Agents for Robot Manipulation

    Seungyeon Kim, Junhoo Lee, Minkyu Kim, Baekseung Kim, Nojun Kwak

  4. #4VisionHOPE: Visual Backbones as Self-Modifying Learning Systems

    Siran Peng, Tianshuo Zhang, Tianyu Fu, Weisong Zhao, Haoyuan Zhang

  5. #5Deep Reinforcement Learning for Robotics: A Survey of Real-World Successes

    DRL을 활용한 로봇 제어 기술의 실제 성공 사례와 주요 과제를 종합적으로 조사한 리뷰 논문.

    Chen Tang, Ben Abbatematteo, Jiaheng Hu, Rohan Chandra, Roberto Martín-Martín

  6. #6Adaptive Keyframe Sampling for Long Video Understanding

    Adaptive Keyframe Sampling(AKS)는 장시간 동영상 이해를 위한 MLLM의 토큰 선택 정확도를 향상시키는 모듈로, LongVideoBench와 VideoMME에서 기존 기준선 대비 높은 정확도를 달성한다.

    Xi Tang, Jihao Qiu, Lingxi Xie, Yunjie Tian, Jianbin Jiao

  7. #7OpenMathInstruct-2: Accelerating AI for Math with Massive Open-Source Instruction Data

    OpenMathInstruct-2는 Llama3.1을 활용해 생성된 14M개의 수학 문제-해답 쌍을 포함한 오픈소스 학습 데이터셋으로, Llama3.1-8B-Base 모델을 fine-tuning한 결과 MATH 데이터셋에서 15.9% 성능 향상을 달성했다.

    Shubham Toshniwal, Wei Du, Ivan Moshkov, B. Kisačanin, Alexan Ayrapetyan

  8. #8Debug like a Human: A Large Language Model Debugger via Verifying Runtime Execution Step by Step

    LDB는 실행 시점 정보를 활용해 생성된 코드를 단계별로 검증하는 LLM 디버깅 프레임워크로, HumanEval 등 3개 벤치마크에서 최대 9.8% 성능 향상.

    Li Zhong, Zilong Wang, Jingbo Shang

  9. #9Recursive Introspection: Teaching Language Model Agents How to Self-Improve

    RISE는 LLM이 단계적으로 자기 개선할 수 있도록 훈련하는 반복적 미세조정 알고리즘으로, 수학 추론 성능을 향상시킨다.

    Yuxiao Qu, Tianjun Zhang, Naman Garg, Aviral Kumar

  10. #10Make Your LLM Fully Utilize the Context

    FILM-7B는 IN2 훈련을 통해 32K 토큰 컨텍스트 내 중간 정보를 효과적으로 활용하는 LLM을 제시한다.

    Shengnan An, Zexiong Ma, Zeqi Lin, Nanning Zheng, Jian-Guang Lou

  11. #11Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement Learning

    Memory-R1은 강화학습을 통해 LLM이 외부 메모리를 적극적으로 관리하고 활용할 수 있도록 하는 첫 번째 프레임워크이다.

    Sikuan Yan, Xiufeng Yang, Zuchao Huang, Ercong Nie, Zifeng Ding

  12. #12HQ-Edit: A High-Quality Dataset for Instruction-based Image Editing

    HQ-Edit는 GPT-4V와 DALL-E 3를 활용한 20만 개의 고해상도 이미지 편집 데이터셋으로, 기존 모델보다 편집 정확도를 12.3% 향상시킨다.

    Mude Hui, Siwei Yang, Bingchen Zhao, Yichun Shi, Heng Wang

  13. #13LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token

    LLaVA-Mini는 1개의 시각 토큰만으로도 LLaVA-v1.5와 유사한 성능을 달성하는 효율적인 멀티모달 모델이다.

    Shaolei Zhang, Qingkai Fang, Zhe Yang, Yang Feng

  14. #279Groupwise Agentic Grading and Advantage Redistribution for Code Agent RL

    Jinhao Dong, Liang Zhao, Zihao Yue, Wenhan Ma, Linghao Zhang

  15. #305Post-Training Leaves Behavioral Shadows on Unrelated Decisions

    Active Taskless Distillation(ATD)를 통해 단일 단어만으로 사후 학습 정보를 전달하고, HumanEval+에서 5.34pp 성능 향상.

    Ziyang Zhang, Yubin Jing, Yuanhao Zeng, Yuyao Li, Haofan Wang

  16. #306Beyond Teacher Assignment: Domain-Normalized Multi-Teacher On-Policy Distillation

    DN-MOPD는 전문가 모델들의 피드백 스케일을 정규화하여 MOPD의 성능 한계를 극복하고, 수학 능력 향상과 다중 태스크 성능 향상을 달성한다.

    Xin Li, Hao Jiang, Xin Gao, Annan Wang, Yuchen Xie

  17. #307WorldPlay2: Extending Real-Time Interactive World Models in Control and Horizon

    WorldPlay2는 실시간 대응과 장기 일관성을 갖춘 하이브리드 제어 인터페이스와 안정적 지도를 결합한 대규모 인터랙티브 월드 모델이다.

    Haiyu Zhang, Wenqiang Sun, Tengfei Wang, Junta Wu, Jun Zhang

  18. #308Imprint Reader: From Weight-Update Readout to Behavioral Intervention

    Imprint Reader는 가중치 업데이트를 자연어로 해독하고 행동 개입을 가능하게 하는 체계적 접근법을 제시한다.

    Guanxu Chen, Qihao Lin, Jing Shao

  19. #309Residual Transferability in Neural Image Watermarking

    Ziping Dong, Qi Li, Xinchao Wang

  20. #310Adapting Vision-Language Models for Human-Readable XAI in Industrial Object Detection

    비전-언어 모델을 활용한 인간 중심 XAI 인터페이스를 제안하여 산업 현장에서의 AI 설명 가능성 향상.

    Sarvenaz Sardari, Freddy Fernandes, Samarth Yelvande, Jose Moises Araya-Martinez, Alina Roitberg

  21. #311How Far Are We from Removing the Visual Encoder? Scaling Laws for Encoder-Free Multimodal Pretraining

    시각 인코더를 제거한 MLLM이 10²² FLOPs 규모에서 기존 인코더 기반 모델과 성능이 수렴할 수 있음을 규모 법칙을 통해 밝힘.

    Lin Chen, Bolin Ni, Qi Yang, Lan Jiang, Kun Ding

  22. #312Learning Native Reflection in Unified Models with Interleaved Reinforcement Learning

    UMM-Reflection은 단일 통합 모델 내에서 반복적 이미지 수정을 학습하는 강화학습 기반 반사 학습 프레임워크로, GenEval에서 SFT 대비 12.05점 개선을 달성한다.

    Yijia Fan, Ziqi Huang, Zhongang Cai, Yan Li, Zimo Wen

  23. #313SentZero: An Enhanced Sentence-Centric Vision-Language Pretraining for Multi-Task Zero-Shot Chest X-Ray Analysis

    SentZero는 병원성 문장 구조를 활용한 새로운 시각-언어 사전 학습 프레임워크로, 병원 흉부 X선 분석에서 제로샷 성능을 향상시킨다.

    Hangyul Yoon, Hyungyung Lee, Edward Choi, Eunho Yang

  24. #314QwenGyre: An Elastic Reinforcement Learning Framework for Training xLong-Horizon Agents

    QwenGyre는 xLong-horizon RL에서 GPU 재할당과 트래젝토리 처리를 통해 1.85× 가속을 달성한 엘라스틱 RL 프레임워크이다.

    Weiqi Wang, Yuxin Zhou, Mouxiang Chen, Siyuan Zhang, Yi Zhang

  25. #315In-Flight KV Cache with Clean Anchors for Faster Autoregressive Video Diffusion

    FlashForward는 자동 회귀 비디오 생성에서 KV 캐시 재사용을 통해 1.42–2.92배 빠른 생성 속도를 달성한 방법이다.

    Yikai Wang, Xiao Han, Mengmeng Xu, Juan Camilo Perez, Yiannis Douratsos

  26. #316Change the Product, Keep the Parameters: Associative Algebra Layers for Transformers

    Transformer의 행렬 곱셈 규칙을 대수적 구조로 대체하여 연산량을 줄이며 생성 속도를 6.2–7.8% 향상시킨다.

    Ilya Koziev, Ivan Oseledets

  27. #317WideSWE: Can Coding Agents Coordinate Changes Across Repositories?

    WideSWE는 여러 레포지토리 간 조율이 필요한 실제 개발 작업을 평가하는 벤치마크로, 최대 42.50%의 작업 성공률을 보임.

    Baoyi Wang, Xingliang Wang, Jinyang Wu, Keming Wu, Chen Zhi

  28. #318FlowTool: Controlling Tool Parameter in Image Retouching via Flow Matching

    FlowTool은 이미지 리터치 작업에서 툴 파라미터를 조절하기 위해 흐름 매칭을 활용한 새로운 프레임워크이다.

    Thanh-Long V. Le, Steven Walton, Seunghyun Yoon, Branislav Kveton, Trung Bui

  29. #319Structured Residual Connectivity Matters for Diffusion Transformers

    Diffusion Transformers에서 구조화된 잔차 연결을 도입해 FID 1.39 달성 및 1.73× 빠른 수렴을 실현.

    Yuhe Liu, Xinyin Ma, Gongfan Fang, Songhua Liu, Xinchao Wang

  30. #320Hard Vision, Easy Vision: What GPT-6 Astra Reveals Across Computer Vision

    GPT-6 Astra는 시각 추론과 구조화된 예측에서 기존 최첨단 시스템을 앞선다.

    Hanoona Rasheed, Mohammed Irfan Kurpath, Bin Ren, Hisham Cholakkal, Fahad Shahbaz Khan

인기 키워드

reinforcement-learning (393) diffusion-models (222) llm (216) llm-agents (177) video-generation (157) llm-evaluation (151) transformer (145) vision-language (144) large-language-models (126) long-context (117) vlm (110) code-generation (105) benchmark-evaluation (100) long-horizon (99) language-models (97) benchmarking (95) foundation-models (82) retrieval-augmented (80) chain-of-thought (76) world-models (76)