HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-09-28 featured 논문 30편

  1. #1AC3D: Analyzing and Improving 3D Camera Control in Video Diffusion Transformers

    AC3D는 3D 카메라 제어를 개선한 비디오 디퓨전 트랜스포머로, 정밀한 카메라 조작과 시각 품질을 동시에 달성한다.

    Sherwin Bahmani, Ivan Skorokhodov, G. Qian, Aliaksandr Siarohin, W. Menapace

  2. #5Paying More Attention to Image: A Training-Free Method for Alleviating Hallucination in LVLMs

    PAI는 훈련 없이 이미지 토큰의 어텐션 가중치를 증폭하고 텍스트 로짓을 감소시켜 LVLM의 환각을 줄이는 인퍼런스 인터벤션 방법이다.

    Shiping Liu, Kecheng Zheng, Wei Chen

  3. #6Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition

    Video-of-Thought(VoT)는 MotionEpic이라는 새로운 비디오 MLLM과 CoT 기반 추론 프레임워크를 결합하여 복잡한 비디오 QA 성능을 획기적으로 향상시킨다.

    Hao Fei, Shengqiong Wu, Wei Ji, Hanwang Zhang, Meishan Zhang

  4. #7Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for LLM Problem-Solving

    LLM 추론 성능을 최적화하기 위해 추론 전략과 모델 크기의 관계를 실증적으로 분석한 연구.

    Yangzhen Wu, Zhiqing Sun, Shanda Li, S. Welleck, Yiming Yang

  5. #8LLaMA-Omni: Seamless Speech Interaction with Large Language Models

    LLaMA-Omni는 Llama-3.1-8B-Instruct 기반으로 구축된, 음성 입력을 직접 텍스트 및 음성 출력으로 생성하는 저지연 음성-LLM 상호작용 모델이다.

    Qingkai Fang, Shoutao Guo, Yan Zhou, Zhengrui Ma, Shaolei Zhang

  6. #9WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling

    WavTokenizer는 24kHz 음성을 초당 40~75개의 토큰으로 압축하면서 뛰어난 재구성 품질과 의미 정보를 유지하는 디스크리트 오디오 코덱 모델이다.

    Shengpeng Ji, Ziyue Jiang, Xize Cheng, Yifu Chen, Minghui Fang

  7. #10MoBA: Mixture of Block Attention for Long-Context LLMs

    MoBA는 MoE 원리를 기반으로 한 Block Attention 메커니즘으로, LLM의 긴 문맥 처리 효율성을 향상시킨다.

    Enzhe Lu, Zhejun Jiang, Jingyuan Liu, Yulun Du, Tao Jiang

  8. #11Rethinking the Bounds of LLM Reasoning: Are Multi-Agent Discussions the Key?

    단일 에이전트가 강력한 프롬프트를 사용하면 다중 에이전트 토론과 유사한 추론 성능을 달성할 수 있음을 실험적으로 밝힘.

    Qineng Wang, Zihao Wang, Ying Su, Hanghang Tong, Yangqiu Song

  9. #12Stable Virtual Camera: Generative View Synthesis with Diffusion Models

    Stable Virtual Camera (SEVA)는 확산 모델 기반으로 입력 뷰와 타겟 카메라로부터 새로운 뷰를 생성하는 일반적인 뉴럴 뷰 합성 모델이다.

    Jensen Zhou, Hang Gao, Vikram S. Voleti, Aaryaman Vasishta, C. Yao

  10. #13FLARE: Feed-Forward Geometry, Appearance and Camera Estimation from Uncalibrated Sparse Views

    FLARE는 2~8장의 비보정 이미지에서 카메라 포즈, 3D 기하, 외관을 0.5초 이내에 추정하는 피드포워드 모델이다.

    Shangzhan Zhang, Jianyuan Wang, Yinghao Xu, Nan Xue, Christian Rupprecht

  11. #318OmniEcho: Spatial Audio Understanding for Embodied Agents

    OmniEcho는 공간 음향 정보를 통합한 다중 모달 모델로, 실제 환경에서의 음향-시각 인식 및 탐색 성능을 향상시킨다.

  12. #322EmbodiedSWE: Coding Agents for Long Horizon Dexterous Robotics

    EmbodiedSWE는 로봇이 복잡한 장기적 작업을 해결하고 이를 정책 학습에 활용하는 프레임워크로, 코드 생성 에이전트와 VLA 학습을 결합한다.

  13. #323PACT: From Credit Assignment to Critic Alignment

    PACT는 신뢰성 있는 크레딧 할당 기반의 정책-비평가 조정을 통해 수학적 추론 및 코드 생성 성능을 72.87%와 67.4%로 향상시킨다.

  14. #325Capable yet Parsimonious: Extracting and Characterizing Hidden Chain-of-Thought in Frontier Models

    GPT-6 Astra는 토큰 효율적이고 직선적인 추론 경로를 통해 높은 성능을 유지하면서도 최소한의 추론 흐름만 외부화한다.

  15. #326GeoPair: Geometry-Preserving Cross-Layer Factorization for Training-Free Transformer Compression

    GeoPair는 훈련 없이 트랜스포머 압축을 수행하는 기하학적 구조를 보존하는 교차 레이어 인수분해 프레임워크이다.

  16. #327ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds

    ExplorationBench는 AI 시스템의 탐색 능력을 측정하기 위한 새로운 벤치마크로, AlienCode와 AlienLogic이라는 2개의 실행 가능한 환경을 통해 새로운 가설을 발견하고 적용하는 능력을 평가한다.

  17. #328Verifiable Hidden Dynamics Play: Generating Agentic RL Environments from Solved Mechanisms

    VHD-Play는 수학 모델 기반 생성 파이프라인을 통해 3,300개의 신뢰 가능한 에이전트 환경을 생성하고, Qwen3.6-35B-A3B 모델의 에이전트 점수를 0.204에서 0.815로 향상시킨다.

  18. #329Learning to Discover Interesting Mathematics

    27B 규모의 모델을 활용해 수학적 정리의 흥미도를 정량화하고, 자율적인 수학적 발견 프레임워크를 제시한다.

  19. #330Parts-of-Speech as Emergent Categories in SAE Latent Space

    LLM의 SAE 잠재 공간에서 형태-문법 정보가 분산된 형태로 나타남을 실증적으로 밝힘.

  20. #331Coding Agents for Generalized Task and Motion Planning Problems

    코딩 에이전트가 일반화된 TAMP 문제 해결에서 기존 기법을 상회하는 성능을 보인다.

  21. #332IterSynth: Rethinking Deep Search Agents via Role-Decoupled Iterative Synthesis

    IterSynth는 역할 분리와 요약 기반 설계를 통해 깊은 검색 성능을 향상시키는 새로운 에이전트 프레임워크이다.

  22. #333WhatWorkedBench: Benchmarking Experimental Understanding in AI Agents

    WhatWorkedBench는 AI 에이전트의 실험적 이해력을 측정하는 벤치마크로, 조건별 구성 요소 효과를 정확히 예측하는 능력을 평가한다.

  23. #334RGBD20K: A Large-Scale Benchmark for RGB-D Semantic Segmentation

    RGBD20K는 160개의 세분화된 카테고리와 20,000개의 RGB-D 이미지 쌍을 포함한 대규모 높은 품질의 RGB-D 세분화 벤치마크 데이터셋이다.

  24. #335All modalities are equal, but video is more equal: Closing the Cross-Attention Gap in Joint Video Generation

    RecCAR은 비디오-모션 및 비디오-오디오 생성에서 상호 모달 일관성을 향상시키는 경량 KL 정규화 기법이다.

  25. #336AgentKernel: The Trust-Native Agentic Operating System

  26. #337On the Diffusibility of High-Dimensional Latents

    고차원 레퍼런스 오토인코더(Representation Autoencoder, RAE)에서 x₀-예측이 텍스트-이미지 생성 성능을 일관되게 향상시킨다.

  27. #338Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures

    Jev 모델은 RLCD를 통해 단일 호출로 10가지 정렬 실패 탐지를 0.886 AUROC 성능으로 제시한다.

  28. #339PUBG Ally: A Conversational Embodied Agent as an AI Teammate

    PUBG Ally는 실시간 게임 플레이와 음성 대화를 결합한 첫 번째 상용 배틀로얄 게임 내 AI 동료이다.

  29. #340AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation

    AV-GRPO는 AV 생성에서 신뢰성 있는 보상 할당과 동기화를 위해 모달리티-앵커드 디코플링 디퓨전 강화학습을 제안한다.

  30. #341Self-Organizing Agent Teams Learn to Reason Together

    AI 에이전트 팀이 협력적 추론을 학습해 개별 에이전트가 도출하지 못한 정답을 생성하는 Self-Organizing Agent Teams (SAT)를 제안한다.

인기 키워드

reinforcement-learning (382) diffusion-models (220) llm (215) llm-agents (175) video-generation (156) llm-evaluation (150) transformer (144) vision-language (140) large-language-models (122) long-context (115) vlm (110) code-generation (103) long-horizon (99) benchmark-evaluation (98) benchmarking (94) language-models (92) foundation-models (80) retrieval-augmented (80) world-models (76) chain-of-thought (75)