HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-08-12 featured 논문 30편

  1. #1PhysAttNet: Enhancing Predictive Performance in Industrial and Astrophysical Time Series via Physics-Informed Attention

    PhysAttNet은 물리 기반 주의 정규화를 통해 CNN 기반 시계열 예측 모델의 정확도와 해석성을 동시에 향상시키는 신경망 구조이다.

    Amal Saadallah, Julia Tjus, Petra Wiederkeher, Wolfgang Rhode

  2. #2Scaling Inherently Interpretable Language Models

    Steerling-8B는 학습 과정에서 해석성을 명시적으로 설계한 확장 가능한 언어 모델로, 1.2트릴리온 토큰 학습 후 1500억 토큰의 미드트레이닝을 거쳐 기존 모델과 유사한 성능을 보인다.

    Guide Labs Team, Andreas Madsen, Aya Abdelsalam Ismail, Giang Nguyen, Isaac Plant

  3. #3LESS: Selecting Influential Data for Targeted Instruction Tuning

    LESS는 대규모 언어 모델의 특정 능력 향상을 위해 5%의 데이터만으로도 전체 데이터셋보다 우수한 성능을 보이는 데이터 선택 알고리즘이다.

    Mengzhou Xia, Sadhika Malladi, Suchin Gururangan, Sanjeev Arora, Danqi Chen

  4. #4Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks

    최신 안전 정렬된 LLM도 간단한 적응형 공격으로 제한 해제가 가능하다는 것을 보여준다.

    Maksym Andriushchenko, Francesco Croce, Nicolas Flammarion

  5. #5NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models

    NV-Embed는 디코더-온리 LLM을 활용한 다목적 임베딩 모델로, MTEB 벤치마크에서 69.32 점을 달성하며 1위를 기록했다.

    Chankyu Lee, Rajarshi Roy, Mengyao Xu, Jonathan Raiman, M. Shoeybi

  6. #6Scaling and evaluating sparse autoencoders

    GPT-4 활성화를 400억 토큰으로 학습한 1600만 레이턴트 SAE를 통해 체계적인 스케일링 법칙과 새로운 평가 지표를 제시한다.

    Leo Gao, Tom Dupr'e la Tour, Henk Tillman, Gabriel Goh, Rajan Troll

  7. #7EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty

    EAGLE는 LLaMA2-Chat 70B 모델에서 2.7x-3.5x의 지연 감소를 달성한 효율적인 추측 샘플링 프레임워크이다.

    Yuhui Li, Fangyun Wei, Chao Zhang, Hongyang Zhang

  8. #8LlaVA-CoT: Let Vision Language Models Reason Step-By-Step

    LLaVA-CoT는 시각적 추론을 단계별로 수행하는 VLM으로, 10만 개의 데이터셋과 SWIRES를 통해 기존 모델을 9.4% 초과.

    Guowei Xu, Peng Jin, Hao Li, Yibing Song, Lichao Sun

  9. #9Continuous 3D Perception Model with Persistent State

    CUT3R은 지속적으로 업데이트되는 내부 상태를 활용해 3D 환경을 온라인으로 재구성하는 통합 3D 인식 모델이다.

    Qianqian Wang, Yifei Zhang, Aleksander Holynski, Alexei A. Efros, Angjoo Kanazawa

  10. #10Visual-RFT: Visual Reinforcement Fine-Tuning

    Visual-RFT는 시각 인식 작업에서 데이터 효율적인 강화 학습 기반 미세 조정을 제안하여 SFT 대비 24.3%의 정확도 향상을 달성한 연구이다.

    Ziyu Liu, Zeyi Sun, Yuhang Zang, Xiao-wen Dong, Yuhang Cao

  11. #11Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research

    Dolma는 3조 토큰 규모의 영어 사전 학습 데이터셋으로, OLMo 모델 학습에 사용된 개방형 언어 모델 연구를 위한 기반 자료이다.

    Luca Soldaini, Rodney Kinney, Akshita Bhagia, Dustin Schwenk, David Atkinson

  12. #12BioMistral: A Collection of Open-Source Pretrained Large Language Models for Medical Domains

    BioMistral 7B는 PubMed Central로 사전 학습된 의료 분야 대형 언어 모델로, 10개 영어 QA 태스크와 7개 언어로 번역된 다국어 평가에서 기존 오픈소스 모델을 상회하는 성능을 보인다.

    Yanis Labrak, Adrien Bazoge, Emmanuel Morin, P. Gourraud, Mickael Rouvier

  13. #163What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systems

    Qwen 앱에서 이미지 생성 대화에서 시각적 일관성을 유지하면서 사용자 선호를 반영한 편집 제안을 생성하기 위한 3단계 프레임워크를 제안한다.

    Zhijing Zhang, Jinpeng Yu, Xin Song, Bingnan Li, Chuyue Li

  14. #304LUCID: Latent-Skill Unified Control via Imagined Dynamics for Long-Horizon Humanoid Loco-Manipulation

    LUCID는 상상된 역학을 기반으로 인간형 로봇의 장기적 로코-조작을 위한 계층적 모델 기반 강화 학습 프레임워크이다.

    Cheng Guo, Mingzhe Ni, Angelo Cangelosi, Arash Ajoudani

  15. #305From Benchmark Performance to Tool Deployment: Human-in-the-Loop Anomaly Detection

    19개의 비지도 이상 탐지 모델이 산업 현장 데이터셋에서 기대 이하의 성능을 보여, 인간-인-더-루프(HITL) 프레임워크를 제안한다.

    Mike Szklarzewski, CJ George, Gavin Smithson, Christopher Stokes, Dakota Fulp

  16. #306RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance

    RynnValue는 7,000시간 이상의 데이터로 학습된 로봇 가치 기초 모델로, 시간 거리 기반의 보상 인터페이스를 통해 정량적 성능을 향상시킨다.

    Dongchi Huang, Hongyin Zhang, Bohan Hou, Siteng Huang, Zhian Su

  17. #307BDH-CQ: In-Context Learning with Recurrent Latent Reasoning

    BDH-CQ는 150M 파라미터로 ARC-AGI-1에서 29.5% pass@2를 달성한, 반복적 잠재 공간 추론과 인-컨텍스트 학습을 결합한 새로운 추론 모델이다.

    Björn Engdahl, Adrian Kosowski, Jan Chorowski, Zuzanna Stamirowska, Przemysław Uznański

  18. #308Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA

    Macaron-V1은 경험 학습과 협업을 위한 개방형 지속 학습 시스템으로, Mixture-of-LoRA와 자기 개선 루프를 결합한 모델이다.

    Mind Lab, :, Vin Bo, Asher Cai, Jingwei Cao

  19. #309SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring

    SWE-Bench ProMax는 7개 언어에 걸쳐 170개의 실제 커밋 기반 리팩토링 태스크로, 기존 벤치마크의 한계를 극복한 다국어 코드 리팩토링 평가 기준이다.

    Yuling Shi, Jinghan Xu, Kelin Fu, Wenhao Zeng, Shilin He

  20. #310DCAS: Decoupling CLI Agent Scaffolding to Internalize Planning across Scaffolds

    DCAS는 CLI 에이전트의 플래닝 구조를 학습 가능한 모델 기능으로 전환하여 다양한 스크래프에서의 성능 저하를 해결한다.

    Kishanthan Thangarajah, Boyuan Chen, Ahmed E. Hassan

  21. #311When Activation Oracles Learn Not to Read: Concept-Specific Blind Spots in Fine-Tuned Oracles

    AO가 훈련된 개념을 의도적으로 회피하는 현상을 밝혀내며, 학습된 해석 도구의 신뢰성 문제를 제기한다.

    Tobias Bersia, Tatiana Gaintseva

  22. #312Enfold: Folding World Model Imagination into Predictive Representations for Ultra-Efficient Embodied Control

    Enfold는 미래 생성 과정을 현재 관측에서 예측 가능한 표현으로 전이하여, 제어 성능을 유지하면서 3.7~10.1배의 액션 지연 감소를 달성한 시스템이다.

    Weili Zeng, Yitong Xing, Fulong Liu, Chengqun Yang, Antao Xiang

  23. #313Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution

    Ouroboros는 자체 개선을 통해 코딩 에이전트 성능을 향상시키는 시스템으로, Terminal-Bench 2.1에서 86.74%를 달성했다.

    Anton Razzhigaev, Andrei Gritsaev, Andrei Kaznacheev, Nikita Dragunov, Roman Yampolskiy

  24. #314SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs

    SFT는 다단계 학습에서 성능 저하를 겪지만, RL은 거의 직교적인 업데이트로 안정적 성능 향상을 보인다.

    Kejian Zhu, Zhuoran Jin, Shangqing Tu, Hongbang Yuan, Yushi Bai

  25. #315Beyond Simply Environment Scaling: Designing Effective Environment Distributions for Multimodal Agent Learning

    AES와 HDC를 통해 다중모달 에이전트 학습의 환경 분포를 효과적으로 설계하는 방법을 제안한다.

    Kejian Zhu, Zhuoran Jin, Dongqi Huang, Hongbang Yuan, Yupu Hao

  26. #316Agent Memory Distillation: Empowering Small LLM Agents with Hierarchical Teacher Memory

    AMD는 GPT-5-mini의 계층적 메모리를 활용해 4B-8B 소형 모델의 정확도를 평균 27.2%p 향상시키는 훈련 없는 메모리 디스틸레이션 프레임워크다.

    Taeil Kim, Kangsan Kim, Sung Ju Hwang

  27. #317Motif 3: Technical Report

    Motif 3는 3140억 파라미터를 가진 MoE 언어 모델로, GDLA와 다양한 최적화 기법을 통해 다중 분야에서 뛰어난 성능을 보인다.

    Junghwan Lim, Joon Son Chung, Sungmin Lee, Wai Ting Cheung, Gihun Cho

  28. #318MatrAIx: Simulating the World with 8.3 Billion Persona Agents

    MatrAIx는 83억 개의 인물 기반 시뮬레이션을 통해 AI 시스템과 디지털 제품을 다각도로 평가하는 인프라를 제시한다.

    Xiaomin Li, Yuexing Hao, Jianheng Hou, Jintao Huang, Qianfeng Wen

  29. #319Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains

    Sci-VBench는 과학 분야에서 지식과 추론이 필요한 동영상 생성 모델을 평가하는 벤치마크로, 1,253개의 전문가 주석이 담긴 예제를 포함한다.

    Diandian Zhang, Tingyu Song, Lin Fu, Zheyuan Yang, Yilun Zhao

  30. #320Stealing Reasoning Traces from Proprietary LLM APIs

    프로피에터리 LLM API의 암호화 추론 흐름을 해킹하여 정보 유출 가능성을 보여준 연구.

    Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer

인기 키워드

reinforcement-learning (331) diffusion-models (190) llm (190) llm-agents (160) video-generation (129) transformer (126) llm-evaluation (125) vision-language (112) vlm (109) long-context (99) large-language-models (94) code-generation (88) long-horizon (86) benchmark-evaluation (82) benchmarking (80) language-models (75) retrieval-augmented (73) flow-matching (68) world-models (68) foundation-models (67)