HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-09-20 featured 논문 30편

  1. #2VLABench: A Large-Scale Benchmark for Language-Conditioned Robotics Manipulation with Long-Horizon Reasoning Tasks

    VLABench는 장기적 계획과 다차원적 추론이 필요한 언어 조건화 로봇 조작을 평가하기 위한 대규모 벤치마크이다.

    Shiduo Zhang, Zhe Xu, Peiju Liu, Xiaopeng Yu, Yuan Li

  2. #4From RAG to Memory: Non-Parametric Continual Learning for Large Language Models

    HippoRAG 2는 인간 장기 기억의 동적 구조를 반영한 RAG 시스템으로, 7%의 연관 기억 성능 향상을 달성한다.

    Bernal Jiménez Gutiérrez, Yiheng Shu, Weijian Qi, Sizhe Zhou, Yu Su

  3. #5Timestep Embedding Tells: It’s Time to Cache for Video Diffusion Model

    TeaCache는 디퓨전 모델의 추론 속도를 4.41× 가속화하면서 시각 품질 저하를 최소화하는 훈련 없이 작동하는 캐싱 전략이다.

    Feng Liu, Shiwei Zhang, Xiaofeng Wang, Yujie Wei, Haonan Qiu

  4. #6Data Engineering for Scaling Language Models to 128K Context

    LLaMA-2 기반 모델을 128K 컨텍스트 길이로 확장하기 위한 데이터 엔지니어링 전략을 제시하며, 1B~5B 토큰의 적절한 데이터 믹스로 GPT-4 128K 수준 성능을 달성한다.

    Yao Fu, Rameswar Panda, Xinyao Niu, Xiang Yue, Hanna Hajishirzi

  5. #7Caduceus: Bi-Directional Equivariant Long-Range DNA Sequence Modeling

    Caduceus는 DNA 역보완성과 양방향성을 고려한 최초의 대규모 DNA 시퀀스 모델이다.

    Yair Schiff, Chia-Hsiang Kao, Aaron Gokaslan, Tri Dao, Albert Gu

  6. #8Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models

    Omni-MATH는 4,428개의 올림피아드 수준 문제로 구성된 LLM 수학 추론 평가 벤치마크로, 기존 모델이 60.54% 이하 정확도를 보임.

    Bofei Gao, Feifan Song, Zhe Yang, Zefan Cai, Yibo Miao

  7. #9PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference

    PKU-SafeRLHF는 LLM 안전 정렬을 위한 대규모 안전 선호도 데이터셋으로, 19개 위험 범주와 3단계 위험 수준을 기반으로 166.8k의 선호도 데이터를 제공한다.

    Jiaming Ji, Donghai Hong, Borong Zhang, Boyuan Chen, Juntao Dai

  8. #10Same Task, More Tokens: the Impact of Input Length on the Reasoning Performance of Large Language Models

    LLM의 입력 길이가 증가할수록 추론 성능이 급격히 저하되며, 이는 기술적 최대치보다 훨씬 짧은 길이에서도 발생한다.

    Mosh Levy, Alon Jacoby, Yoav Goldberg

  9. #11DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos

    DepthCrafter는 110프레임 길이의 개방세계 동영상에 대해 시간적으로 일관된 고해상도 깊이 시퀀스를 생성하는 새로운 방법이다.

    Wenbo Hu, Xiangjun Gao, Xiaoyu Li, Sijie Zhao, Xiaodong Cun

  10. #12ImgEdit: A Unified Image Editing Dataset and Benchmark

    ImgEdit은 120만 개의 편집 쌍을 포함한 고질량 이미지 편집 데이터셋과 평가 벤치마크를 제시하여 오픈소스 모델 성능을 향상시킨다.

    Yang Ye, Xianyi He, Zongjian Li, Bin Lin, Shenghai Yuan

  11. #208PACT: Can Enterprise AI Assistants Be Trusted Under Pressure?

    PACT는 기업 AI 어시스턴트의 규정 준수를 압박 상황에서 평가하는 벤치마크로, 22개 모델의 6~10% 규칙 위반과 65% 평균 위반 증가를 보여준다.

    Mika Okamoto, Ansel Kaplan Erol

  12. #305DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression

    DeepSeek-V4.1-Flash는 KV 캐시 압축 기술을 통해 1M 토큰 컨텍스트를 처리하는 552B 파라미터 MoE 모델로, KV 캐시 용량을 기존 모델 대비 1/4~1/8로 줄였다.

    DeepSeek-AI, :, Anyi Xu, B. Li, Bangcai Lin

  13. #308Don't Mask the Environment: Observation Supervision Changes How Agents Explore Under RL

    ActObs는 환경 관측값을 예측 대상으로 포함시켜 강화학습 초기화를 개선하여 GRPO 후 탐색 성능을 향상시킨다.

    Juzheng Zhang, Disha Makhija, Manoj Ghuhan Arivazhagan, Vinayshekhar Bannihatti Kumar, Rashmi Gangadharaiah

  14. #309Can MiniMax-H3 Reason About the Physical World? An Evaluation of Omni-Modal Generative Model

    MiniMax-H3의 물리적 세계 추론 능력을 다중 모달 입력 기반 평가 프레임워크로 평가한 연구.

    Haoyu Zhao, Zihao Zhao, Tianyu Deng, Ziqin Xu, Zihao Zhang

  15. #310VākQA: A Benchmark and Evaluation Study for Telugu Spoken Factoid Question Answering

    텔루구어 음성 기반 팩트오이드 QA 벤치마크 VākQA를 제안하고, 평가 방법과 모델 성능을 분석한다.

    Bhavana Akkiraju, Ravi Sastry Kolluru, Sri Charan D, Srihari Bandarupalli, Santosh Kesiraju

  16. #311When EOS Tokens Disagree: Understanding Length Inflation in On-Policy Distillation

    OPD에서 길이 과장 문제를 유발하는 EOS 토큰 불일치를 분석하고, 이를 해결하기 위한 종단 동작 정렬 전략을 제안한다.

    Yuxiao Yang, Tianrun Yu, Shangzhe Li, Kaixiang Zhao, Xuchao Zhang

  17. #312SoL-Pi: Recursively Scaling Auto-Research Loops for Efficient Agent Harness

    SoL-Pi는 자동 연구 루프를 통해 토큰 효율성을 44.7–49.0% 개선한 에이전트 헤이버스 시스템이다.

    Haozhe Liu, Tian Ye, Sensen Gao, Qihang Cao, Yitong Li

  18. #316An Empirical Study of Harness Design for Coding Agents

    코드 생성 에이전트의 하네스 성능을 모듈별로 분석한 실험 연구.

    Run-Ze Fan, Zihao Zhang, Simin Ma, Yebowen Hu, Shouju Wang

  19. #319HypoEvolve: Genetic Algorithms Enable Multi-Agent LLMs to Discover Scientific Hypotheses

    HypoEvolve는 과학적 가설의 질을 향상시키기 위해 유전 알고리즘을 활용한 다 에이전트 LLM 시스템이다.

    Jieyuan Liu, Mengzhou Hu, Jefferson Chen, JungHo Kong, Pratibha Jagannatha

  20. #321JEPA-Anything: Learning Predictive Models across Different Worlds

    JEPA-Anything는 다양한 도메인에서 예측 모델링을 가능하게 하는 통합 프레임워크로, 정교한 인자 분해와 재사용 가능한 예측 구조를 통해 성능을 향상시킨다.

    Taoyong Cui, Zhongyao Wang, Xinyue Xu, Weiyang Liu, Zhaochen Yu

  21. #322VC-Attention: Value Smoothing and Softmax Casting for Low-bit Attention

    VC-Attention은 비트 수를 줄인 상태에서 정확도와 속도를 동시에 향상시키는 트레이닝 없는 어텐션 기법이다.

    Xingyang Li, Dongyun Zou, Shining Zhang, Jiacheng Chen, Haocheng Xi

  22. #323Verifiable Social Reasoning for LLM Assistants

    LLM 어시스턴트의 일상적 사회적 추론 능력을 평가하기 위한 새로운 시뮬레이션 프레임워크 Fuse를 제안하고, 12개 모델을 분석하여 사용자 매개 변수의 영향을 밝혀냈다.

    Amir Taubenfeld, Zorik Gekhman, Avigail Grinstein-Dabush, Itay Laish, Ariel Goldstein

  23. #325RiskChainBench: A Benchmark for Obfuscated Platform Message Restoration and Evidence-Grounded Web Investigation

    RiskChainBench는 위장된 메시지 복원과 증거 기반 웹 조사의 연계성을 평가하는 새로운 벤치마크로, 3,600개의 토큰-텍스트 입력과 600개의 로컬 웹 환경을 제공한다.

    ZhuoXin Liu, Zhiming Ma, Ying Zhang, Mengzheng Yang, Yifan Wang

  24. #326RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning

    RetireOPD는 강화학습 기반 에이전트에 기술 정보를 내재화하는 자가 퇴역형 온-폴리시 디스틸레이션 방법으로, ALFWorld와 WebShop에서 성능을 11.8%~18.8% 개선한다.

    Yan Yu, Zhengxi Lu, Yizhou Liu, Yichen Pan, Aozhe Wang

  25. #327Reflect, Revise, Reuse: Training-Free Skill Evolution for GUI Agents

    EvoSkill-GUI는 GUI 에이전트의 실행 피드백을 기반으로 훈련 없이 스킬을 수정하는 반복 루프를 통해 성능을 향상시킨다.

    Bofan Chen, Boxuan Zhang, Fei Tang, Zhengxi Lu, Yong Du

  26. #328Self-Evolving Search Index

    SELF-INDEX는 인덱스 키를 자동 진단·수정·검증하는 프레임워크로, 다양한 검색 환경에서 검색 성능을 지속적으로 향상시킨다.

    Sangam Lee, Wonjae Lee, Sunghwan Kim, Deogyong Kim, Jaehoon Kim

  27. #329WeVisDoc: From Coverage to Capability for Robust End-to-End Document Parsing

    WeVisDoc은 두 단계의 데이터 중심 프레임워크로, 다양한 문서 파싱 성능을 95.38 (OmniDocBench v1.6)까지 향상시킨다.

    Hao Yu, Kang Liu, Linnan Zhao, Jiabo Zhan, Chong Sun

  28. #330Video DeltaNet: A Video-Native Hybrid Attention for Livestream Video Generation

    Video DeltaNet(VDN)은 영상 생성 속도를 14.5× 향상시키는 하이브리드 어텐션 구조를 제안한다.

    Haocheng Xi, Yiming Xie, Hexu Zhao, Yiwen Zhang, Michael Liu

  29. #331A Zeroth-Order Paradigm for LLM Preference Alignment

    ComPO는 비교 오라클 기반의 제로차 수식 선호 정렬 방법으로, 소량의 가능성 차이를 가진 선호 쌍을 활용해 모델 정렬 성능을 향상시킨다.

    Peter Chen, Xi Chen, Wotao Yin, Tianyi Lin

  30. #332Gaze as Evidence for Common Grounding: A Cross-Corpus Analysis of MapTask and MUNDEX

    지도자 역할 수행자의 시선 행동이 협업 과제에서 의미 정착을 반영한다는 것을 두 대규모 대화 코퍼스에서 분석적으로 입증했다.

    Nan Li, Albert Gatt, Massimo Poesio

인기 키워드

reinforcement-learning (362) diffusion-models (210) llm (206) llm-agents (168) video-generation (144) llm-evaluation (142) transformer (137) vision-language (131) large-language-models (112) long-context (112) vlm (110) code-generation (100) benchmark-evaluation (92) long-horizon (92) language-models (88) benchmarking (87) retrieval-augmented (80) foundation-models (78) world-models (73) flow-matching (72)