HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-09-14 featured 논문 30편

  1. #2TableBench: A Comprehensive and Complex Benchmark for Table Question Answering

    TableBench는 18개 분야의 복잡한 TableQA 능력을 평가하는 새로운 벤치마크로, GPT-4조차 인간 수준에 도달하지 못함을 보여준다.

    Xianjie Wu, Jian Yang, Linzheng Chai, Ge Zhang, Jiaheng Liu

  2. #4BABILong: Testing the Limits of LLMs with Long Context Reasoning-in-a-Haystack

    BABILong 벤치마크는 LLM이 긴 문서 내 분산된 사실을 추론하는 능력을 평가하며, 최대 5000만 토큰 처리 가능 모델을 제시한다.

    Yuri Kuratov, A. Bulatov, Petr Anokhin, I. Rodkin, Dmitry Sorokin

  3. #5MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer

    MaskGCT는 정렬 정보와 단위별 지속 시간 예측 없이, 마스킹-예측 학습을 기반으로 100K 시간의 데이터에서 최고 수준의 제로샷 TTS 성능을 달성한 2단계 비자귀적 모델이다.

    Yuancheng Wang, Haoyue Zhan, Liwei Liu, Ruihong Zeng, Haotian Guo

  4. #6Emotion-LLaMA: Multimodal Emotion Recognition and Reasoning with Instruction Tuning

    Emotion-LLaMA는 멀티모달 감정 인식과 추론을 위해 MERR 데이터셋과 instruction tuning 기법을 결합한 최신 모델로, 다양한 데이터셋에서 뛰어난 성능을 보인다.

    Zebang Cheng, Zhi-Qi Cheng, Jun-Yan He, Jingdong Sun, Kai Wang

  5. #7Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models

    Hi Robot은 복잡한 언어 지시와 피드백을 처리하는 계층적 시각-언어-액션(VLA) 모델을 사용하여 오픈엔드 작업 수행이 가능한 로봇 시스템이다.

    L. Shi, Brian Ichter, Michael Equi, Liyiming Ke, Karl Pertsch

  6. #8Fast Timing-Conditioned Latent Audio Diffusion

    Stable Audio는 텍스트와 타이밍 조건을 기반으로 44.1kHz 스테레오 오디오를 빠르게 생성하는 라티언트 디퓨전 모델이다.

    Zach Evans, CJ Carr, Josiah Taylor, Scott H. Hawley, Jordi Pons

  7. #93D Gaussian Splatting as Markov Chain Monte Carlo

    3D Gaussian Splatting을 MCMC 샘플링으로 재구성하여 초기화와 휴리스틱을 제거하고 렌더링 품질을 향상시킨다.

    Shakiba Kheradmand, Daniel Rebain, Gopal Sharma, Weiwei Sun, J. Tseng

  8. #10Assessing the Brittleness of Safety Alignment via Pruning and Low-Rank Modifications

    LLM의 안전 메커니즘이 3% 이하의 파라미터와 2.5% 이하의 랭크만으로 구성되어 있어 취약하다는 점을 실증적으로 밝힘.

    Boyi Wei, Kaixuan Huang, Yangsibo Huang, Tinghao Xie, Xiangyu Qi

  9. #11No Pose, No Problem: Surprisingly Simple 3D Gaussian Splats from Sparse Unposed Images

    NoPoSplat은 카메라 포즈 없이 3D 가우시안을 실시간으로 재구성하는 단순한 피드포워드 모델이다.

    Botao Ye, Sifei Liu, Haofei Xu, Xueting Li, Marc Pollefeys

  10. #12SWE-smith: Scaling Data for Software Engineering Agents

    SWE-smith는 소프트웨어 엔지니어링 에이전트 학습 데이터를 대규모로 생성하는 파이프라인으로, 128개 리포지토리에서 50,000개의 인스턴스를 생성해 기존 방식 대비 10배 규모 확장.

    John Yang, Kilian Adriano Lieret, Carlos E. Jimenez, Alexander Wettig, K. Khandpur

  11. #307The Price of Sparsity: Sufficient Conditions for Sparse Recovery using Sparse and Sparsified Measurements

    이 연구는 희소 측정 행렬을 사용한 희소 신호의 support recovery에 대한 정보 이론적 한계와 trade-off를 분석한다.

    Youssef Chaabouni, David Gamarnik

  12. #313X-AuT: Progressive Audio-Encoder Compression for Speech LLMs with Cross-Scale Distillation

    X-AuT는 Qwen3-ASR 모델의 오디오 인코더를 점진적으로 압축하면서 정확도를 유지하는 프레임워크로, 14층 모델에서 20.7%의 파라미터 감소와 5.75%의 매크로 오류를 달성한다.

  13. #315An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics

    Nemotron-3-Ultra 기반 시스템이 2026년 국제수학올림피아드에서 42점 중 30점 획득하며 금메달 기준 달성.

  14. #316FreeFlow: A Bias-free Hierarchical Transformer for Optical Flow Estimation

    FreeFlow는 기존의 흐름 추정에서 사용되던 편향 요소를 배제한 히에라키형 트랜스포머로, Sintel, KITTI-2015, Spring에서 최신 성능을 달성한다.

  15. #317MetroLLM-Bench: Evaluating Language Models as Transit Kiosk Runtimes

    MetroLLM-Bench는 대중교통 키오스크 정책 실행을 위한 언어 모델 평가 벤치마크로, 4B Qwen 3.5 학생 모델이 GPT-5.6을 초과하며 2.6GB의 낮은 메모리 요구를 보인다.

  16. #318HyQuant: Hybrid-Precision Quantization for LLM Attention

    HyQuant는 LLM의 어텐션 모듈을 혼합 정밀도로 양자화하여 정확도와 효율성을 균형 있게 유지하는 프레임워크이다.

  17. #319Negative Self-Distillation: Learning to Reason by Avoiding Flaws

    NSD는 LLM이 스스로 생성한 오류 추론을 피하도록 훈련하여 수학적 추론 성능을 향상시키는 새로운 자기 부트스트랩 프레임워크이다.

  18. #320TempCloze: Can Video-LLMs Identify the Missing Middle?

    TempCloze는 영상 기반 대형 언어 모델의 시각적 시간 추론 능력을 평가하기 위한 새로운 비디오 클로즈 벤치마크이다.

  19. #321Studying Image Tokenizers as Visual Languages in Unified Multimodal Models

    이미지 토크나이저가 통합 멀티모달 모델에서 어떻게 텍스트와 상호작용하는지, 손실 기반 실험을 통해 분석한다.

  20. #322Recursive Code World Models: Building Complex Worlds through Recursive Scene Programs

    RCWM은 단일 이미지에서 재귀적 코드 프로그램을 생성해 복잡한 3D 세계를 재구성하는 새로운 프레임워크이다.

  21. #323World in World: Explore the World with World Models

    World in World(WiW)는 학습 없이 동영상 월드 모델을 다양한 시점에서 제어하는 시각적 증거 인터페이스를 제시한다.

  22. #324Building Multilingual Bridges: Data Mixing as the Pillar of Generalization for In-Language Reasoning

    3.35B 규모의 Tiny Aya L2-Thinker 모델을 통해 60개 언어에서 93% 이상의 L2 추론률을 달성하며, 다국어 추론 성능을 확장하는 데이터 중심 접근법을 제시한다.

  23. #325Beyond Solver Verdicts: Generative Reward Models for Autoformalization

    GenV+HN은 Z3 기반 오프라인 검증 정보를 활용해 참조-동등성을 검증하는 생성적 검증 모델로, 0.961 AUROC 성능을 달성하고 11.3포인트의 정확도 향상을 유도한다.

  24. #326Generative Late-Interaction Embeddings For Visual Document Retrieval

    GLIE는 저장 공간 효율성을 유지하면서도 정확도를 보존하는 새로운 후처리 기반의 시각 문서 검색 방법이다.

  25. #327UniH^3: Unifying Hierarchical Homogeneity and Heterogeneity for All-in-One Medical Image Restoration

    UniH3는 의료 이미지 복원의 다중 태스크와 모달리티를 통합하는 새로운 프레임워크로, 계층적 동질성과 이질성을 동시에 모델링한다.

  26. #328CARDEA: Auditable Reasoning Grounded in Spatial Evidence for End-to-End Coronary Angiography Interpretation

    CARDEA는 강력한 시각-언어 모델과 Chain-of-Box 추론을 결합해 치료 결정을 지지하는 체계적 CAG 해석 파이프라인을 제공한다.

  27. #330Adaptive Bridge: A Proxy-Based Decoupling Layer for Mitigating DDS Backpressure in ROS 2

    Adaptive Bridge는 ROS 2의 DDS 백프레셔 문제를 해결하기 위해 주요 구독자를 분리하는 프록시 기반 레이어를 제안한다.

  28. #331Think Before You Link: Rarity, Reasoning, and Retrieval in Multilingual Entity Linking

    다국어 다모달 엔티티 링킹에서 희귀 엔티티 처리를 위해 추론과 검색을 결합한 훈련 없는 프레임워크를 제안한다.

  29. #332ActReview: Rebuttal-Guided Training Data and Rubric Rewards for Actionable Peer Review Generation

    ActReview는 저자 반박을 활용한 행동 가능한 피어 리뷰 생성을 위한 후-트레이닝 프레임워크로, 진단 생성과 수정 제안 생성을 구조화하여 리뷰 품질을 향상시킨다.

  30. #333IdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications

    IdeaAMBIG는 연구 아이디어의 구현 준비 상태를 평가하기 위한 660개의 구체적 결함 인스턴스를 포함한 벤치마크로, LLM이 결함을 탐지하고 명확히 하기 어려움을 보여준다.

인기 키워드

reinforcement-learning (353) diffusion-models (203) llm (200) llm-agents (166) llm-evaluation (138) video-generation (138) transformer (132) vision-language (126) vlm (109) long-context (105) large-language-models (102) code-generation (98) long-horizon (91) benchmark-evaluation (89) benchmarking (86) language-models (82) retrieval-augmented (78) foundation-models (73) flow-matching (72) world-models (72)