HotPaper.ai — 매일 자동 큐레이션되는 AI 논문 Top 25 + 한국어 요약

2026-09-29 featured 논문 30편

  1. #1Is LLM-as-a-Judge Robust? Investigating Universal Adversarial Attacks on Zero-shot LLM Assessment

    LLM을 사용한 제로샷 평가 시스템이 단어 수준의 공격으로 과도한 점수를 부여받는 취약성을 드러냄.

    Vyas Raina, Adian Liusie, Mark J. F. Gales

  2. #2OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning

    OCRBench v2는 LMM의 시각 텍스트 이해 능력을 체계적으로 평가하기 위한 대규모 이중 언어 벤치마크로, 23개의 핵심 작업과 31개의 다양한 시나리오를 포함한다.

    Ling Fu, Biao Yang, Zhebin Kuang, Jiajun Song, Yuzhe Li

  3. #5ReFT: Representation Finetuning for Language Models

    ReFT는 기존 PEFT 대비 15~65배 더 파라미터 효율적인 언어 모델 미세조정 방법으로, LoReFT가 다양한 태스크에서 최고 성능을 보인다.

    Zhengxuan Wu, Aryaman Arora, Zheng Wang, Atticus Geiger, Daniel Jurafsky

  4. #6OR-Bench: An Over-Refusal Benchmark for Large Language Models

    OR-Bench는 대규모 과거절(over-refusal) 프롬프트를 생성하고 32개 LLM의 거부율을 평가한 첫 번째 벤치마크이다.

    J. Cui, Wei-Lin Chiang, Ion Stoica, Cho-Jui Hsieh

  5. #7ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL

    ArCHer는 대규모 언어 모델의 다중 턴 에이전트 작업 학습을 위해 계층적 강화 학습 프레임워크를 제안하며, 기존 방법 대비 100배 높은 샘플 효율성을 달성한다.

    Yifei Zhou, Andrea Zanette, Jiayi Pan, Sergey Levine, Aviral Kumar

  6. #8Morphometric Imitation: From Morphology and Contact Aware Hand Retargeting to Sim-to-Real Visuomotor Policy

  7. #9SWIFT:A Scalable lightWeight Infrastructure for Fine-Tuning

    SWIFT는 350개 이상의 LLM과 80개 이상의 MLLM을 지원하는 오픈소스 파인튜닝 인프라로, 다양한 후처리 기술을 통합하여 대형 모델 활용을 용이하게 한다.

    Yuze Zhao, Jintao Huang, Jinghan Hu, Xingjun Wang, Yunlin Mao

  8. #10Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning

    VLM을 강화학습으로 미세조정하여 7b 모델이 GPT4-V, Gemini를 초과하는 결정력 향상.

    Yuexiang Zhai, Hao Bai, Zipeng Lin, Jiayi Pan, Shengbang Tong

  9. #11Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy Data

    대규모 언어 모델의 선호도 미세조정에서 온정책 샘플링과 음의 경사를 활용하는 접근법이 성능을 향상시킨다.

    Fahim Tajwar, Anikait Singh, Archit Sharma, Rafael Rafailov, Jeff G. Schneider

  10. #12A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity

    DPO 알고리즘을 통해 GPT2-medium 모델의 독성 감소 메커니즘을 분석하고, 이를 우회하는 방법을 제시한다.

    Andrew Lee, Xiaoyan Bai, Itamar Pres, Martin Wattenberg, Jonathan K. Kummerfeld

  11. #13AutoDAN-Turbo: A Lifelong Agent for Strategy Self-Exploration to Jailbreak LLMs

    AutoDAN-Turbo는 인간 개입 없이 자동으로 범죄적 프롬프트 전략을 탐색하고, GPT-4-1106-turbo에서 93.4%의 공격 성공률을 달성한 블랙박스 제이블레이크 프레임워크이다.

    Xiaogeng Liu, Peiran Li, Edward Suh, Yevgeniy Vorobeychik, Z. Mao

  12. #285Tactile-JEPA: Topology-Aware Self-Supervised Representation Learning for Distributed Tactile Sensors

    Tactile-JEPA는 터치 센서의 위상 정보를 활용한 자기감독 학습으로, 터치 인코더 성능을 6.3%~20.8% 개선한다.

  13. #308IndicBankBench: Evaluating Safety and Reliability of Language Model Assistants in Indian Retail Banking

  14. #309FuseReg: Regularizing Layer Fusion Mitigates the Reconstruction-Generation Gap in Representation Autoencoders

  15. #311InternW0-Δ: A World Action Model Bridging Predictive Dynamics and Actions with 20K+ Hours of Open Data

    InternW0-Δ는 20K시간 이상의 이질적 데이터로 학습한 세계 행동 모델로, 시각 역학과 행동 생성을 통합하여 로봇 제어 성능을 향상시킨다.

  16. #314FoMo: Forking Moment in Generative Trajectory as a Perceptual Distance

  17. #315RayOrch: Programming and Executing Lineage-Controlled Multi-Grain Dataflows for Foundation-Model Data Preparation

  18. #318TRACE: Temporal Audit and Condition-aware Evaluation of Streaming Video Understanding

  19. #319Block Sparse Attention with Log-Linear Complexity

    PISA는 로그-선형 복잡도를 갖는 블록 스파스 어텐션 메커니즘으로, 긴 문맥 처리 성능을 향상시킨다.

  20. #320ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds

    ExplorationBench는 AI 시스템의 탐색 능력을 측정하기 위한 새로운 벤치마크로, AlienCode와 AlienLogic이라는 2개의 실행 가능한 환경을 통해 새로운 가설을 발견하고 적용하는 능력을 평가한다.

  21. #321VLA-Precision: Asymmetric Co-Bootstrapping for Efficient Real-World Online RL of Vision-Language-Action Models

    VLA-Precision은 정밀한 실제 환경 온라인 강화학습을 위한 비대칭 공부트스트랩 알고리즘과 아키텍처를 제시한다.

  22. #324Coding Agents for Generalized Task and Motion Planning Problems

    코딩 에이전트가 일반화된 TAMP 문제 해결에서 기존 기법을 상회하는 성능을 보인다.

  23. #325PUBG Ally: A Conversational Embodied Agent as an AI Teammate

    PUBG Ally는 실시간 게임 플레이와 음성 대화를 결합한 첫 번째 상용 배틀로얄 게임 내 AI 동료이다.

  24. #326Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures

    Jev 모델은 RLCD를 통해 단일 호출로 10가지 정렬 실패 탐지를 0.886 AUROC 성능으로 제시한다.

  25. #328Spectral Feedback for Test-Time Alignment of Protein Diffusion Models

    Spectral Feedback는 테스트 타임에 단백질 생성 모델의 생성물을 반복적으로 수정하여 안정성을 32.3% 향상시키는 알고리즘이다.

  26. #329Inquesto Score: A reliability Protocol For Voice Agents

  27. #330SAGE: Source-Anchored Guidance via Frequency Equalization for Hierarchical RGB-T Alignment and Fusion

    SAGE는 주파수 영역 기반의 통합적 RGB-T 정합 및 융합 프레임워크로, 주파수 동등화와 계층적 정합을 통해 정합 정확도와 융합 품질을 향상시킨다.

  28. #331Enhancing Photogrammetric Digital Surface Models with Pretrained Diffusion Models and Multimodal Conditioning

    이 연구는 Stable Diffusion 3를 수정하여, 사진측량 DSM을 고정된 LiDAR 수준으로 정제하는 다중모달 조건 확산 모델을 제안한다.

  29. #332Jev in the Wild: A Data-Driven Analysis of the Jev Model's Functionality, Applications and Ecosystem

    Jev 모델의 공개 생태계를 분석하여 다양한 도메인에서의 활용 패턴과 주목도를 정량적으로 조사했다.

  30. #333RGBD20K: A Large-Scale Benchmark for RGB-D Semantic Segmentation

    RGBD20K는 160개의 세분화된 카테고리와 20,000개의 RGB-D 이미지 쌍을 포함한 대규모 높은 품질의 RGB-D 세분화 벤치마크 데이터셋이다.

인기 키워드

reinforcement-learning (386) diffusion-models (222) llm (216) llm-agents (175) video-generation (156) llm-evaluation (151) transformer (144) vision-language (141) large-language-models (125) long-context (116) vlm (110) code-generation (103) benchmark-evaluation (99) long-horizon (99) benchmarking (95) language-models (94) foundation-models (81) retrieval-augmented (80) chain-of-thought (76) world-models (76)