- #1PromptAD: Learning Prompts with only Normal Samples for Few-Shot Anomaly Detection
PromptAD는 정상 샘플만을 사용해 few-shot 환경에서 이상 탐지를 수행하는 one-class prompt 학습 방법으로, MVTec 및 VisA 데이터셋에서 11/12 설정에서 1위 성능을 달성한다.
- #2Kernel Language Entropy: Fine-grained Uncertainty Quantification for LLMs from Semantic Similarities
Kernel Language Entropy(KLE)는 LLM의 의미적 불확실성을 정량화하기 위한 새로운 방법으로, 기존 semantic entropy를 일반화하고 여러 생성 데이터셋에서 성능을 개선한다.
- #3RoboTok: An Internet-Scale Data Engine for Human Demonstration Retrieval and Dexterous Manipulation Learning
RoboTok은 인터넷 영상에서 인간 조작 동작을 추출해 로봇 정책 학습에 활용하는 대규모 데이터 엔진이다.
- #4Watch Out for Your Agents! Investigating Backdoor Threats to LLM-Based Agents
LLM 기반 에이전트에 대한 백도어 공격의 다양한 형태와 취약성을 분석하고, 기존 방어법의 한계를 밝힌 연구.
- #5VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement
VeriPhy는 생성된 동영상의 물리적 일관성을 체계적으로 검증하는 시스템으로, 149개 클립에서 304개 결함 중 228개를 감지했다.
- #6MiniCheck: Efficient Fact-Checking of LLMs on Grounding Documents
MiniCheck는 GPT-4 수준의 정확도를 400배 저비용으로 달성하는 소형 사실 검증 모델이다.
- #7Sapiens: Foundation for Human Vision Models
Sapiens는 1K 해상도에서 2D 포즈, 부위 세그멘테이션, 깊이, 표면 정규 벡터 예측을 수행하는 인간 중심 시각 모델로, 300M 개의 인간 이미지로 학습하여 기존 기준을 7.6 mAP~53.5% 개선한다.
- #8ArtPrompt: ASCII Art-based Jailbreak Attacks against Aligned LLMs
ASCII 아트를 활용한 새로운 제이크브레이크 공격 ArtPrompt가 기존 안전 정렬 기법의 취약점을 드러낸다.
- #9EMO: Emote Portrait Alive - Generating Expressive Portrait Videos with Audio2Video Diffusion Model under Weak Conditions
EMO는 오디오-비디오 확산 모델을 활용해 3D 중간 표현 없이 표현력 있는 토킹헤드 영상을 생성하는 새로운 프레임워크이다.
- #10Are Language Models Actually Useful for Time Series Forecasting?
대형 언어 모델(LLM)은 시계열 예측에서 성능 개선에 기여하지 않으며, 단순한 대체 모듈이 더 효율적임을 밝힘.
- #11Shape of Motion: 4D Reconstruction From a Single Video
단일 비디오에서 3D 운동 궤적을 포함한 4D 재구성을 위한 새로운 방법을 제안한다.
- #12AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling
AnyGPT는 텍스트, 이미지, 음성, 음악 등 다양한 모달을 이산 시퀀스로 통합 처리하는 any-to-any 멀티모달 언어 모델이다.
- #303Compile by Training: Turning Natural-Language Specifications into Local Neural Functions
자연어 명세를 기반으로 로컬 신경망 함수를 생성하는 "Compile by Training" 방법을 제안한다.
- #304Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments
Terminal-Universe는 기존 에이전트 트레이잭토리에서 실행 가능한 환경을 재구성하고 새로운 작업을 합성하여 터미널 기반 코드 에이전트의 학습을 확장하는 프레임워크이다.
- #305LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes
LLaDA-Image는 6B 규모의 DiT와 LLaDA2.0-Mini 기반 VLM을 결합한 오픈소스 이미지 생성 프레임워크로, 220M 샘플 중 98%가 실제 이미지이며 Qwen-Image-Bench에서 53.53 점을 달성했다.
- #306Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning
Random Attention은 KV 캐시에서 무작위 추출을 통해 기존 선택 신호를 대체하면서도 성능을 유지하고 처리량을 32–43% 증가시킨다.
- #307Knowing When Not to Reuse: Conditional Experience Transfer in Autonomous LLM Post-Training
BCIT는 자율적 사후 훈련에서 과거 경험의 조건부 재사용을 결정하는 문제를 해결하는 방법이다.
- #308LatentPress: Context Compression Beyond Text and Vision
LatentPress는 언어 모델이 텍스트 복원 없이 직접 읽을 수 있는 연속 메모리 토큰을 생성하여 대규모 컨텍스트를 압축하는 새로운 인터페이스를 제시한다.
- #309Rethinking On-Policy Distillation of Large Language Models II: One Training Example
단일 훈련 예시로도 대규모 언어 모델의 온-폴리시 디스틸레이션(OPD) 성능을 크게 회복할 수 있음을 밝힘.
- #310Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLM
Gated DeltaNet(GDN) 기반의 Qwen3.8-27B 모델을 NVFP4 W4A4로 전체 496개의 선형층을 4비트로 양자화하여 BF16 수준 성능을 달성한 연구.
- #311Puffin-World: Scaling a Unified Multimodal Model with Native 3D World States
Puffin-World는 물리, 기하, 외관을 통합한 3D 월드 생성 및 재구성을 위한 단일 프레임워크로, Omni-Camera와 Physics Propagation을 통해 물리적으로 일관되고 시각적으로 안정적인 월드 모델링을 실현한다.
- #312Scal3R: Learning Efficient Multi-Relative Pose Query for Scalable Online 3D Reconstruction
Scal3R은 KITTI 데이터셋에서 평균 ATE를 60% 이상 개선하며, 1% 미만의 파라미터로 온라인 3D 재구성을 안정적으로 수행하는 다중 참조 상대 자세 쿼리 프레임워크이다.
- #313Editable Visual Design
"Editable Visual Design"은 코드 생성과 시각 생성 모델을 결합해 편집 가능한 디자인을 실현하는 새로운 패러다임이다.
- #314The Missing Temporal Link: Temporal Context Routing for Script-Driven Audio-Video Generation
TCR은 스크립트 기반 동영상 생성에서 비디오와 오디오의 타이밍을 스크립트와 정확히 맞추는 기술로, Shot Boundary MAE 96% 감소, Dialogue [email protected] 84.1% 달성.
- #316Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding
LatentStream은 스트리밍 영상 이해를 위해 내재적 잠재 메모리 진화를 통해 기존의 저장-검색 패러다임을 극복하는 프레임워크로, 다양한 벤치마크에서 최신 성능을 달성한다.
- #317WHALE: A Simple Recipe for Joint Harness-Weight Optimization
WHALE은 모델 가중치와 실행 가능한 헤이븐 코드를 번갈아 최적화함으로써 에이전트 성능을 향상시키는 모듈식 프레임워크이다.
- #319Last Translation Benchmark
기존 기계 번역 모델의 한계를 평가하기 위한 새로운 벤치마크인 Last Translation Benchmark(LTB)를 제안한다.
- #320RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests
RealSWE는 실제 사용자 요청에 기반한 코드 생성 에이전트 평가 프레임워크로, 정보 구성과 언어 스타일의 차이를 분석하고 이를 기반으로 381개의 다중 변형 태스크를 제공한다.
- #321CORE: Improving Compositional Reasoning in MLLM Embedding via Reranker Distillation
CORE는 MLLM 기반 임베딩 모델의 구성적 추론 능력을 랭커를 통해 증대시키는 랭크-디스틸레이션 기반 프레임워크이다.
- #322NeoMME: A Single-Tower Multimodal-Native Multilingual Foundation Encoder for Efficient Fine-Tuning and Inference
NeoMME는 단일 트랜스포머 인코더로 멀티모달 및 다국어 텍스트와 이미지를 처리하는 효율적인 기반 모델이다.