HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-10-07 featured 논문 30편

  1. #1ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model

    ChatVLA는 Phased Alignment Training과 Mixture-of-Experts를 결합해 MMMU에서 6배, MMStar에서 47.2% 성능을 달성한 통합형 VLA 모델이다.

    Zhongyi Zhou, Yichen Zhu, Minjie Zhu, Junjie Wen, Ning Liu

  2. #2VISA: Reasoning Video Object Segmentation via Large Language Models

    VISA는 대규모 언어 모델을 활용해 암묵적 텍스트 쿼리에 기반한 비디오 객체 분할을 수행하는 새로운 ReasonVOS 태스크를 제안한다.

    Cilin Yan, Haochen Wang, Shilin Yan, Xiaolong Jiang, Yao Hu

  3. #3Training Deep Learning Models with Norm-Constrained LMOs

    Scion이라는 새로운 LMO 기반 최적화 알고리즘을 제안하여 nanoGPT 학습 속도를 향상시키고 메모리 효율성을 확보한다.

    T. Pethick, Wanyun Xie, Kimon Antonakopoulos, Zhenyu Zhu, Antonio Silveti-Falls

  4. #4Which Agent Causes Task Failures and When? On Automated Failure Attribution of LLM Multi-Agent Systems

    LLM 멀티에이전트 시스템의 실패 원인을 자동으로 추적하는 새로운 연구 분야를 제안하고, 실패 로그를 기반으로 한 Who&When 데이터셋을 소개한다.

    Shaokun Zhang, Ming Yin, Jieyu Zhang, Jiale Liu, Zhiguang Han

  5. #5When Attention Sink Emerges in Language Models: An Empirical View

    언어 모델에서 첫 번째 토큰에 과도한 어텐션(attention sink)이 발생하는 현상을 실증적으로 분석하고, 이 현상이 학습 과정과 어텐션 구조에 어떻게 영향을 받는지 밝힌다.

    Xiangming Gu, Tianyu Pang, Chao Du, Qian Liu, Fengzhuo Zhang

  6. #6Scaling up Masked Diffusion Models on Text

    1.1B 매스킹 디퓨전 모델(MDM)이 자동회귀 모델(ARM)과 유사한 성능을 보이며, 수학 추론 및 샘플링 속도에서 우수함.

    Shen Nie, Fengqi Zhu, Chao Du, Tianyu Pang, Qian Liu

  7. #7VideoScore: Building Automatic Metrics to Simulate Fine-grained Human Feedback for Video Generation

    VideoScore는 37.6K개의 영상에 대한 인간 평가를 기반으로 학습하여, 기존 지표 대비 50점 이상 높은 상관계수(77.1)를 달성한 자동 영상 평가 모델이다.

    Xuan He, Dongfu Jiang, Ge Zhang, Max W.F. Ku, Achint Soni

  8. #8IRSAM: Advancing Segment Anything Model for Infrared Small Target Detection

    IRSAM은 적외선 소형 타겟 탐지(IRSTD)를 위해 SAM의 인코더-디코더 구조를 개선한 모델로, WPMD와 GAD 모듈을 통해 성능을 크게 향상시킨다.

    Mingjin Zhang, Yuchun Wang, Jie-Ru Guo, Yunsong Li, Xinbo Gao

  9. #9Probing the 3D Awareness of Visual Foundation Models

    시각 기초 모델이 3D 구조를 얼마나 잘 인식하는지 탐구한 연구로, DINOv2와 StableDiffusion이 2D 학습에도 3D 정보를 부분적으로 인코딩함을 밝힘.

    Mohamed El Banani, Amit Raj, Kevis-Kokitsi Maninis, Abhishek Kar, Yuanzhen Li

  10. #10InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD

    InternLM-XComposer2-4KHD는 4K HD 해상도까지 처리 가능한 최초의 대규모 시각-언어 모델로, 10개 벤치마크에서 GPT-4V와 Gemini Pro를 능가한다.

    Xiao-wen Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Bin Wang

  11. #301Memadapter: Counterfactual Adaptation Against Memory-induced Sycophancy

    MemAdapter는 장기 기억 유도의 서코판시를 방지하기 위해 후처리 단계에서 기억 활용을 적응적으로 조절하는 프레임워크로, 3단계 구조로 구성되어 있음.

    Ruqing Ning, Haibo Meng, Zhishang Xiang, Zerui Chen, Jinsong Su

  12. #302MM-ABC: Towards Generalist Mobile Manipulation via Seeing, Coordinating and Imagining

    MM-ABC는 이동 및 조작의 협업을 학습하는 모바일 조작 기반 모델로, 다양한 데이터에서 61.2% 성공률을 달성.

    Qiwei Liang, Guangyu Chen, Shaolong Zhu, Zikuan Xiao, Jinxuan Lu

  13. #303Adapting prior-data fitted networks for tabular anomaly detection

    TabPFN 기반의 사전 학습 모델을 적응시켜 탭류 데이터 이상 탐지를 개선하는 방법을 제안한다.

    Maximilian Bershtman, Niv Cohen

  14. #304Video2Skill: From Streaming Experience to Reusable Embodied Skills

    Video2Skill은 스트리밍 영상에서 재사용 가능한 신체 기반 스킬을 발견하는 기준 평가 프레임워크로, 19개의 VLM 모델을 통해 스킬 그룹화 및 재사용 결정의 한계를 분석한다.

    Jianshu Zhang, Ce Zhang, Xiyuan Yang, Chenwei Xu, Haoran Lu

  15. #305ProgressCompass: Embodied Progress Reward Models Are Lost Without the Right Context

    ProgressCompass는 적절한 컨텍스트를 제공함으로써, 복잡한 작업에서 Progress Reward Model(PRMs)의 정확도를 63% 개선하는 자율 에이전트 루프를 제안한다.

    Jianshu Zhang, Keliang Wu, Chengxuan Qian, Xiyuan Yang, Ce Zhang

  16. #306Periscope: Extending Frozen Language Models Beyond Their Context Window

    Periscope는 텍스트를 분할 읽고 결합하여 컨텍스트 윈도우를 확장하는 추론 방법으로, 27B 모델이 4.5M 토큰을 80GB GPU에서 처리 가능하다.

    Mohamed Eltahir, Anas Obayd, Raed Rashid, Abdulrahman Alghamdi, Abdulrahman Mousa

  17. #307In-Distribution Forcing for Long Video Generation at Test Time

    Jeongwoo Shin, Youngyoon Choi, Sangwoo Jo, Hyunmog Kim, Sungjoon Choi

  18. #308LMBuild: Evaluating LLM Agents for Generating Buildable and Functional Structures

    LMBuild는 생성된 3D 구조물이 실제로 제작 가능하고 기능적으로 작동하는지 평가하는 체계적인 벤치마크를 제시한다.

    Jiateng Liu, Rushi Wang, Cheng Qian, Xuejun Zhang, Sun Li

  19. #309Foundations of Proactive Agents: Principles, Technical Layers, and Proactivity-Gym

    이 연구는 3T(작업 능력, 시간 할당, 신뢰) 원칙을 기반으로 한 프로액티브 LLM 에이전트의 설계, 구현, 평가 기초를 제시하며, Proactivity-Gym이라는 시뮬레이션 평가 테스트베드를 소개한다.

    Jio Oh, Seunghyun Do, Young-Jun Lee, Steven Euijong Whang, Dongyeop Kang

  20. #310Self-Generated Feedback Destabilizes Test-Time Training: A Causal Decomposition of Long-Horizon Adaptation

    Cheng Luo, Bing Li, Bernard Ghanem

  21. #311World Editing: Intervening on Executable Worlds at Increasing Depth

    실행 가능한 게임 세계에 대한 의도적 편집 능력을 평가하는 IGMWorld와 IGMBench를 제안하며, 편집 깊이가 성능에 미치는 영향을 분석한다.

    Max Ku, Nok-Kan Law, Yu-Chien Tang, Shih-Ying Yeh, Ping Nie

  22. #312GeoCR: Learning a Generalist Cloud Removal Prior from Heterogeneous Observations

    Jeonghyeok Do, Munchurl Kim

  23. #313OpenRUA: Robot-Use Agents Are Zero-Shot Visuomotor Policies

    OpenRUA는 ROS 2 인터페이스를 통해 코드 작성 에이전트가 제로샷으로 로봇 제어를 수행할 수 있음을 보여주는 제로-추상화 허네스 시스템이다.

    Zhaoyang Chu, Earl T. Barr, Claire Le Goues, Peter O'Hearn, Mark Harman

  24. #314Optimizing the Optimizer: Language Models Discover Faster Molecular Relaxation

    AutoSella는 언어 모델 기반 자동 연구를 통해 개선된 분자 기하 최적화 알고리즘으로, Sella 대비 40.2–77.2% 적은 힘 평가 수를 요구한다.

    Artem Tsypin, Vladimir Deshchenya, Kuzma Khrabrov, Denis Potapov, Maxim Radchenko

  25. #315Data Unlearning via Inverse Distillation

    IDU는 다단계 매칭 모델을 효율적인 단계 생성자로 증류하면서 지정된 학습 집합을 억제하는 통합 프레임워크이다.

    Aleksei Leonov, Nikita Kornilov, Zhenhe Zhang, Evgeny Burnaev, Iaroslav Koshelev

  26. #316Representation-Space MMD for Diffusion Language Models

    DLM의 생성 품질을 향상시키기 위해 MMD 최적화를 기반으로 post-training을 수행하는 방법을 제안한다.

    Ilya Drobyshevskiy, Ilia Sudakov, Maksim Semenov, Denis Kuznedelev, Maksim Ignatov

  27. #317OmniReasoning: Pushing the Limits of Audio-Visual Joint Reasoning

    OmniReasoning-30B-A3B는 오디오-비주얼 결합 추론을 강화하기 위해 설계된 벤치마크, 데이터 엔진, 학습 방법을 제시하며 OmniReasoningBench에서 42.5% 성능을 달성한다.

    Junming Lin, Yuxuan Wang, Zhenxin Lei, Yuxin Liu, Ruixun Liu

  28. #318SearchJev: A Fast and Calibrated System-1 Model for Search Agents

    SearchJev는 빠르고 신뢰도 높은 System-1 모델로, 검색 에이전트의 단기 결정을 직접 예측하고 System-2에 위임하는 이중 시스템을 제안한다.

    Congfeng Cao, Lipeng Zuo, Konstantinos Papakostas, Qiwei Xu, Songwei Xu

  29. #319RobotUse: Allocating Computation, Context, and Decisions

    RobotUse는 물리적 행동을 지정하고 수정하는 데 초점을 맞춘 로봇 에이전트 허네스를 제시하며, RoboLab에서 45%의 작업 성공률을 달성한다.

    Junhoo Lee, Injun Baek, Seungyeon Kim, Suhyun Jeon, Minkyu Kim

  30. #320Conformal Prediction with Paraphrase-Aware Scoring for LLM Uncertainty Quantification

    Jiayi Xin, Evan Qiang, Zihan Zhu, Xiang Li, Weijie J. Su

인기 키워드

reinforcement-learning (405) diffusion-models (232) llm (220) llm-agents (184) video-generation (164) llm-evaluation (157) vision-language (157) transformer (150) large-language-models (132) long-context (120) vlm (112) code-generation (110) language-models (105) long-horizon (103) benchmark-evaluation (102) benchmarking (99) foundation-models (84) chain-of-thought (81) retrieval-augmented (81) world-models (79)