HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-09-07 featured 논문 30편

  1. #3Iterative Reasoning Preference Optimization

    Iterative Reasoning Preference Optimization (IRPO)는 DPO 기반 수정 손실 함수를 반복적으로 적용하여 Llama-2-70B-Chat의 추론 성능을 GSM8K에서 55.6% → 81.6%로 향상시키는 방법이다.

    Richard Yuanzhe Pang, Weizhe Yuan, Kyunghyun Cho, He He, Sainbayar Sukhbaatar

  2. #4Chain-of-Table: Evolving Tables in the Reasoning Chain for Table Understanding

    Chain-of-Table은 테이블 기반 추론 과정에서 테이블 자체를 중간 사고의 매개체로 활용하여, LLM의 예측 정확도를 향상시키는 새로운 프레임워크이다.

    Zilong Wang, Hao Zhang, Chun-Liang Li, Julian Martin Eisenschlos, Vincent Perot

  3. #5U-KAN Makes Strong Backbone for Medical Image Segmentation and Generation

    U-KAN은 KAN을 U-Net에 통합하여 의료 이미지 분할 및 생성에서 뛰어난 성능과 해석성을 제공하는 새로운 백본을 제안한다.

    Chenxin Li, Xinyu Liu, Wuyang Li, Cheng Wang, Hengyu Liu

  4. #6Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models

    Audio Flamingo 3(AF3)는 음성, 소리, 음악을 통합한 대규모 오픈 소스 오디오-언어 모델로, 10분 긴 오디오 이해 및 추론 등 새로운 기능을 도입하고 20개 이상의 벤치마크에서 최고 성능을 달성했다.

    Arushi Goel, Sreyan Ghosh, JaeHyeon Kim, Sonal Kumar, Zhifeng Kong

  5. #7Rotary Position Embedding for Vision Transformer

    2D RoPE-Mixed를 활용한 Vision Transformer(ViT)의 정밀도 향상과 해상도 확장 성능 개선을 제시한다.

    Byeongho Heo, Song Park, Dongyoon Han, Sangdoo Yun

  6. #8StoryDiffusion: Consistent Self-Attention for Long-Range Image and Video Generation

    StoryDiffusion은 일관된 자기주의 계산과 의미 공간 기반 동작 예측을 통해 장거리 이미지 및 동영상 생성을 가능하게 한다.

    Yupeng Zhou, Daquan Zhou, Ming-Ming Cheng, Jiashi Feng, Qibin Hou

  7. #9HAC: Hash-grid Assisted Context for 3D Gaussian Splatting Compression

    HAC는 3D Gaussian Splatting 앵커의 구조적 관계를 해시 그리드로 모델링하여 75× 압축 성능을 달성한 3DGS 압축 프레임워크다.

    Yihang Chen, Qianyi Wu, Jianfei Cai, Mehrtash Harandi, Weiyao Lin

  8. #10Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models

    Molmo는 외부 VLM 없이 자체적으로 수집한 PixMo 데이터셋을 기반으로 훈련된 최고 수준의 오픈 가중치-데이터 VLM이다.

    Matt Deitke, Christopher Clark, Sangho Lee, Rohun Tripathi, Yue Yang

  9. #11Self-Play Preference Optimization for Language Model Alignment

    SPPO는 인간 선호의 비이성적 특성을 반영한 게임 이론 기반 언어 모델 정렬 방법으로, UltraFeedback 데이터셋과 PairRM 0.4B 모델로 28.53%의 길이 제어 승률을 달성한다.

    Yue Wu, Zhiqing Sun, Huizhuo Yuan, Kaixuan Ji, Yiming Yang

  10. #12CRM: Single Image to 3D Textured Mesh with Convolutional Reconstruction Model

    CRM은 단일 이미지에서 10초 이내에 고해상도 텍스처 메시를 생성하는 컨볼루션 기반 3D 생성 모델이다.

    Zhengyi Wang, Yikai Wang, Yifei Chen, Chendong Xiang, Shuo Chen

  11. #317Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding

    LatentStream은 스트리밍 영상 이해를 위해 내재적 잠재 메모리 진화를 통해 기존의 저장-검색 패러다임을 극복하는 프레임워크로, 다양한 벤치마크에서 최신 성능을 달성한다.

    Hongyu Qu, Guangming Yao, Ling Xing, Xiaobin Hu, Rongxing Ding

  12. #318Last Translation Benchmark

    기존 기계 번역 모델의 한계를 평가하기 위한 새로운 벤치마크인 Last Translation Benchmark(LTB)를 제안한다.

    Vilém Zouhar, Niyati Bafna, Mukund Choudhary, Maike Züfle, Sara Rajaee

  13. #319RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests

    RealSWE는 실제 사용자 요청에 기반한 코드 생성 에이전트 평가 프레임워크로, 정보 구성과 언어 스타일의 차이를 분석하고 이를 기반으로 381개의 다중 변형 태스크를 제공한다.

    Gyuhyeong Kim, Hyojung Gwon, Jeonghyeon Kim, Kyuhong Shim, Sunjae Lee

  14. #321NeoMME: A Single-Tower Multimodal-Native Multilingual Foundation Encoder for Efficient Fine-Tuning and Inference

    NeoMME는 단일 트랜스포머 인코더로 멀티모달 및 다국어 텍스트와 이미지를 처리하는 효율적인 기반 모델이다.

    Aurélien Lac, Tony Wu

  15. #323CORE: Improving Compositional Reasoning in MLLM Embedding via Reranker Distillation

    CORE는 MLLM 기반 임베딩 모델의 구성적 추론 능력을 랭커를 통해 증대시키는 랭크-디스틸레이션 기반 프레임워크이다.

    Tingyu Song, Mingxin Li, Yanzhao Zhang, Dingkun Long, Chu Liu

  16. #324DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training

    DRACO는 GRPO 내에서 동적 루브릭을 생성하고 이를 기반으로 단계별 보상을 할당하여, AppWorld에서 기존 방법 대비 15.9점 개선된 성능을 달성한 신규 신용 할당 방법이다.

    Shubham Gandhi, Saurabh Goyal, Kiran Kate, Yara Rizk

  17. #325WorldReward: Reward Modeling for Camera-Conditioned World Models

    WorldReward는 카메라 조건에 따른 월드 모델의 행동 일관성과 시각 품질을 통합 평가하는 VLM 기반 이진 선호 보상 모델이다.

    Yibin Wang, Zehan Wang, Junshu Tang, Zhimin Li, Yujie Zhou

  18. #326PACE: Towards Surfacing Hidden Conflicts in User Requests

    PACE 데이터셋과 PaceMaker 다중 에이전트 프레임워크를 제안하여 사용자 요청의 은밀한 충돌을 식별하는 성능을 향상시킨다.

    Yoojin Kim, Jihyoung Jang, Hyounghun Kim

  19. #327FlashRender: Few-Step Generative Rendering via Camera-Controlled Video MeanFlow

    FlashRender는 RETA, MeanFlow, on-policy flow map distillation을 통해 25배 적은 샘플링 비용으로 높은 품질의 카메라 제어 동영상 재렌더링을 실현한 few-step generative rendering 모델이다.

    Byeongjun Park, Byung-Hoon Kim, Hyungjin Chung

  20. #328Using Grounded Theory for Agent Behavior Analysis at Scale

    AutoTraceGT는 대규모 에이전트 트레이잭토리 분석을 위한 첫 번째 자동화된 Grounded Theory 파이프라인으로, 7,500개 이상의 데이터에서 73-91%의 실패 원인을 복구한다.

    Zhuoran Lu, Yangyang Yu, Zhuoyan Li, Yibo Meng, Nan Jiang

  21. #329Environment Evolution for Terminal Agents

    환경 진화(Environment Evolution)를 통해 RL 학습 시 지속적인 학습 신호를 제공하고, Terminal-Bench 2.1 성능을 최대 18.0% 개선한다.

    Zhiyuan Fan, Tinghao Yu, Yuanjun Cai, Jiang Zhou, Jiangtao Guan

  22. #330Principia: Relational Physics Tests for Video Models

    Principia는 물리적 관계 일관성을 기준으로 동영상 생성 모델의 물리적 추론 능력을 평가하는 벤치마크로, 8가지 현상에 걸쳐 500개 이상의 실제 장면을 포함한다.

    Varun Varma Thozhiyoor, Shivam Tripathi, Venkatesh Babu Radhakrishnan, Anand Bhattad

  23. #331A Glance Is All You Need: Single-Pass Fine-Grained Image Captioning with SimLoss

    SimLoss는 단일 패스로 세부 정보를 포함한 이미지 캡션을 생성하는 새로운 임베딩 공간 기반의 학습 방법이다.

    Suryaansh Jain, Rahasya Barkur, Vishal G, Ryan Rossi, Franck Dernoncourt

  24. #332Select, Compress, Reinvest: A Controlled Study of Visual-Token Allocation in Long-Video MLLMs

    1시간 길이 동영상에서 8개의 적절히 선택된 프레임이 16개의 균일하게 선택된 프레임보다 6.9점 높은 성능을 보인다.

    Prakhar Khatri

  25. #333VibeVoice-ASR-Streaming Technical Report

    VibeVoice-ASR-Streaming은 실시간 화자 속성 ASR을 위한 최초의 LLM 기반 스트리밍 모델로, 단일 모델로 ASR과 화자 인식을 통합하고 2.0초 평균 지연을 달성한다.

    Yujie Tu, Zhiliang Peng, Jianwei Yu, Li Dong, Songchen Xu

  26. #334Percolation Dynamics in Optimization : Variance Cascades and Discrete Scale Invariance

    SGD의 동역학을 투과 현상(percolation)으로 모델링하여, 신경망의 구조적 축소와 불연속적 상전이를 설명한다.

    Sai Niranjan Ramachandran, Suvrit Sra

  27. #335QCell: Recombining and Aligning Cell Queries for Overlapping Instance Segmentation

    QCell은 반투명 세포의 겹침 구분을 위해 인스턴스 재조합 모듈과 대비 학습을 결합한 쿼리 기반 세포 인스턴스 분할 모델이다.

    Yaroslav Prytula, Anton Popov, Dmytro Fishman

  28. #336Let Confidence Change, Not the Prediction: Prediction-Preserving Repair for Post-hoc Calibration

    CORD는 예측을 유지하면서 신뢰도만 보정하는 후처리 보정 기법으로, TPCR 0%와 ECE, NLL, Brier 점수 개선을 달성한다.

    Daehwan Kim, Haejun Chung, Ikbeom Jang

  29. #337A Common Measure of Communication for Speech Brain-Computer Interfaces

    OVMI는 다양한 환경에서의 스피치 BCI 성능을 비교할 수 있는 정보 이론적 지표로, 기존 정확도 대비 최대 16.3% 개선 효과를 보인다.

    Dulhan Jayalath, Benjamin Ballyk, Oiwi Parker Jones

  30. #338Locked at the Entrance, Open Inside: Where RLVR Narrows the Solution Space

    RLVR로 인한 추론 다양성 감소는 계산 시작 단계에서 발생하며, 이는 정확도 향상과 상충하는 문제다.

    Qiancheng Zhou, Ruizhe Li

인기 키워드

reinforcement-learning (333) diffusion-models (193) llm (192) llm-agents (160) video-generation (133) llm-evaluation (128) transformer (126) vision-language (118) vlm (109) long-context (99) large-language-models (94) code-generation (88) long-horizon (88) benchmark-evaluation (84) benchmarking (82) language-models (76) retrieval-augmented (75) world-models (69) flow-matching (68) foundation-models (67)