- #1Uncertainty-Aware World Model for Aerial Image-Goal Navigation
UA-NWM은 미래 상태의 불확실성을 고려한 항공 이미지-목표 탐색을 위한 효율적인 월드 모델이다.
- #2Improved Distribution Matching Distillation for Fast Image Synthesis
DMD2는 분포 일치 기반 지도 학습을 통해 단계 수를 500배 줄이며 FID 1.28의 높은 품질 이미지를 생성한다.
- #3MVSplat: Efficient 3D Gaussian Splatting from Sparse Multi-View Images
MVSplat은 22fps의 빠른 추론 속도와 10배 적은 파라미터로, RealEstate10K 및 ACID 벤치마크에서 최고 성능을 달성한 효율적인 3D Gaussian Splatting 모델이다.
- #4Benchmarking Retrieval-Augmented Generation for Medicine
의학 분야에서 RAG 시스템의 최적 설정을 평가하기 위한 MIRAGE 벤치마크와 MedRAG 툴킷을 제안하고, 1.8조 개의 프롬프트 토큰을 기반으로 41가지 조합 실험을 수행한 연구.
- #5VideoMamba: State Space Model for Efficient Video Understanding
VideoMamba는 Mamba 기반 SSM을 활용해 비디오 이해를 효율적으로 수행하는 새로운 모델로, 장단기 동작 인식 및 멀티모달 호환성을 뛰어넘는 성능을 보인다.
- #6JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models
JailbreakBench는 대형 언어 모델의 탈옥 공격을 평가하기 위한 오픈 소스 벤치마크이다.
- #7SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents
SeeClick은 GUI 화면 캡처만을 기반으로 작업을 자동화하는 시각 기반 GUI 에이전트로, GUI grounding을 강화한 결과 ScreenSpot 벤치마크에서 기존 LVLM 기반 모델을 상회한다.
- #8Executable Code Actions Elicit Better LLM Agents
CodeAct는 LLM 에이전트가 실행 가능한 Python 코드를 생성하여 행동을 통합하고, 20% 높은 성공률을 달성하는 새로운 프레임워크이다.
- #9MOMENT: A Family of Open Time-series Foundation Models
MOMENT는 다양한 시간 시계열 분석을 위한 오픈소스 기초 모델로, Time-series Pile 데이터셋과 마스킹 기반 사전 학습을 통해 제한된 데이터에서도 뛰어난 성능을 보인다.
- #10KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache
KIVI는 튜닝 없이 키-벨류 캐시를 2비트로 양자화하여 LLM 추론 메모리 사용량을 2.6배 감소시키는 알고리즘이다.
- #11BLINK: Multimodal Large Language Models Can See but Not Perceive
BLINK는 시각 인지 능력을 평가하는 새로운 멀티모달 LLM 벤치마크로, 인간은 쉽게 풀지만 기존 모델은 어려움을 겪는다.
- #100World-to-Wrist: Task-Conditioned Future Wrist Modeling for Fine-Grained Robot Manipulation
W2-VLA는 글로벌 작업 맥락을 고려한 미래 손목 움직임 예측을 통해 정밀 로봇 조작 성능을 향상시키는 VLA 모델이다.
- #303EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning
EnvACE는 외부 환경 없이 정책이 자체적으로 환경 응답을 생성하는 월드 리허설을 통해 강화 학습 에이전트를 학습하는 새로운 방법이다.
- #304From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models
경제 세계 모델(EWM) 구현을 위한 시스템 설계와 6단계 능력 구조를 제시하며, AI 및 인간 의사결정자용 고정밀 시뮬레이션 환경 개발을 촉진한다.
- #305DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces
DataSpace는 410개의 다국어 작업 공간을 기반으로, 데이터 에이전트의 정확한 테이블 결과 생성 능력을 평가하는 벤치마크로, 최고 정확도는 66.34%에 달한다.
- #306DCAS: Decoupling CLI Agent Scaffolding to Internalize Planning across Scaffolds
DCAS는 CLI 에이전트의 플래닝 구조를 학습 가능한 모델 기능으로 전환하여 다양한 스크래프에서의 성능 저하를 해결한다.
- #307Interpretable MEG Decoding of Perceived Speech: Cortical Sources and the Stimulus Features That Drive Retrieval
MEG 신호에서 인지된 음성 재구성을 위해 해석 가능한 디코더를 설계하고, 그 기저 뇌 활성과 자극 특성을 분석한다.
- #308OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models
OSReward는 컴퓨터 사용 에이전트(CUA)의 성능을 평가하는 VLM 판정 모델의 신뢰도를 체계적으로 평가하고, 저비용으로 신뢰할 수 있는 보상 신호를 제공하는 오픈 벤치마크와 모델을 제시한다.
- #309When Activation Oracles Learn Not to Read: Concept-Specific Blind Spots in Fine-Tuned Oracles
AO가 훈련된 개념을 의도적으로 회피하는 현상을 밝혀내며, 학습된 해석 도구의 신뢰성 문제를 제기한다.
- #310Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills
로봇 학습은 고정된 가중치와 자가 개선 가능한 스킬이라는 두 축으로 나뉘고 있다.
- #311Douyin Multimodal Embedding Model Technical Report
도우틴(Douyin)은 대규모 멀티모달 임베딩 모델 DME를 제안하여 검색 및 추천 성능을 향상시켰다.
- #312SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs
SFT는 다단계 학습에서 성능 저하를 겪지만, RL은 거의 직교적인 업데이트로 안정적 성능 향상을 보인다.
- #313Do AI Personas Grow? Analyzing and Benchmarking Personality Evolution in LLM Agents After Life Events
LLM 에이전트의 성격 변화를 인간 심리학 데이터와 비교해 평가하는 새로운 벤치마크를 제시한다.
- #314Teaching Nemotron Greek: Mining a Corpus, Adapting Retrieval, and Grounding Generation for Modern Greek across Specialist Domains
현대 그리스어를 위한 Nemotron 검색 모델과 RAG 벤치마크 HERA를 구축하고 성능을 개선했다.
- #315Beyond Simply Environment Scaling: Designing Effective Environment Distributions for Multimodal Agent Learning
AES와 HDC를 통해 다중모달 에이전트 학습의 환경 분포를 효과적으로 설계하는 방법을 제안한다.
- #316Characterizing the Quality Profile of AI-Generated C++ in Production
AI 생성 C++ 코드는 인터페이스 및 메모리 관리 문제로 인해 5-8%의 컴퓨팅 비용 증가를 초래하지만, 분류기반 피드백으로 11.1%의 경고 감소를 달성.
- #317Activity Frames: Deterministic Screen-Activity Compilation for Agent Memory and Replay
"Activity Frames"는 사용자의 스크린 활동을 결정론적 컴파일로 변환하여 에이전트 메모리의 신뢰성과 효율성을 높인다.
- #318SimWAM: A Simple World Action Model for End-to-End Autonomous Driving
SimWAM은 비용이 많이 드는 미래 프레임 생성 없이도 높은 성능을 보이는 간단한 월드-액션 모델로, NAVSIM에서 91.5 PDMS를 달성한다.
- #319PaDoc: Layout-Grounded Parallel Decoding for Document Parsing
PaDoc은 레이아웃 기반 병렬 디코딩을 통해 문서 파싱의 처리 속도와 정확도를 동시에 향상시킨 단일 MLLM 기반 모델이다.
- #320KVAE: Family of Tokenizers for Multimodal Generative Models
KVAE는 텍스트 조건을 기반으로 생성하는 멀티모달 모델을 위한 새로운 토크나이저 시리즈로, 이미지, 비디오, 오디오에서 기존 오픈소스 토크나이저를 능가하는 성능을 보인다.