- #1AdaCLIP: Adapting CLIP with Hybrid Learnable Prompts for Zero-Shot Anomaly Detection
AdaCLIP은 CLIP에 하이브리드 학습 가능한 프롬프트를 결합해 제로샷 이상 탐지 성능을 향상시키는 모델이다.
- #2Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing
Hunyuan3D-Buffalo 1.0은 87M 규모의 3D 다중모달 데이터셋을 기반으로 3D 이해, 생성, 편집을 통합한 첫 단일 아키텍처다.
- #3Material-Segmented Per-Pixel Emissivity Correction for Thermographic Anomaly Detection in Cultural Heritage Digital Twins
문화유산 디지털 트윈의 열화상 이상 탐지에서 화소별 발사율 보정을 위한 훈련 없는 파이프라인을 제안한다.
- #4AgentStream: How Well Do Self-Evolving LLM Agents Perform Under Streaming Tasks?
AgentStream은 다양한 스트리밍 시나리오에서 자기 진화하는 LLM 에이전트의 성능을 체계적으로 평가하는 통합 프레임워크이다.
- #5Unified Training of Universal Time Series Forecasting Transformers
Moirai는 다양한 주파수와 다변량 시계열을 처리하는 대규모 유니버설 트랜스포머로, 27B개의 LOTSA 데이터셋에서 사전 학습되어 제로샷 성능이 기존 모델을 앞선다.
- #6VideoCrafter2: Overcoming Data Limitations for High-Quality Video Diffusion Models
VideoCrafter2는 저품질 데이터를 활용해 고품질 비디오 생성 모델을 학습하는 새로운 훈련 전략을 제안한다.
- #7LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding
LongVideoBench는 1시간 길이의 영상-언어 복합 입력을 처리하는 대규모 다중 모달 모델을 평가하기 위한 새로운 벤치마크이다.
- #8xLSTM: Extended Long Short-Term Memory
xLSTM은 LSTM을 확장한 새로운 아키텍처로, Transformer와 경쟁할 수 있는 성능을 보인다.
- #9MobileNetV4 - Universal Models for the Mobile Ecosystem
MobileNetV4는 다양한 모바일 하드웨어에서 Pareto 최적 성능을 보이는 모델로, UIB, Mobile MQA, NAS 개선, 디스틸레이션 기법 등을 통해 87% ImageNet-1K 정확도를 달성한다.
- #10ORPO: Monolithic Preference Optimization without Reference Model
ORPO는 참조 모델 없이 SFT 단계에서 직접 선호도를 최적화하는 새로운 알고리즘으로, 7B 모델로도 12.20%의 AlpacaEval 성능을 달성한다.
- #11An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models
FastV는 LVLM에서 이미지 토큰의 불필요한 어텐션 계산을 제거하여 추론 비용을 45%까지 절감하는 플러그 앤 플레이 방식의 효율화 기법이다.
- #12WildChat: 1M ChatGPT Interaction Logs in the Wild
WildChat은 100만 건의 실제 사용자-ChatGPT 대화 기록을 담은 다국어, 다차례 대화 데이터셋으로, 사용자 행동 분석 및 대화 모델 튜닝에 활용 가능하다.
- #13Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think
REPA 정규화를 통해 디퓨전 트랜스포머의 생성 성능과 학습 효율성이 크게 향상된다.
- #46Quo Vadis, World Modeling?
세계 모델링을 에이전트 중심의 정보 전환 프록시로 확장하여 지속적 개선을 지원한다.
- #305GeoID-PINN: Identifiability-Aware Regional Epidemic Inference with Geographic Coupling
GeoID-PINN은 지역 간 유행 구조를 식별하는 데 공간 정보를 통합한 물리 기반 신경망 모델이다.
- #306ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts
ST-WAM은 시각 분포 변화에 강한 조작을 위한 의미-시간적 세계 행동 모델로, DINOv3와 VAE를 결합한 이중 공간 예측과 현재-앵커 인텐트 검색을 제안한다.
- #307Knowledge-Geometry Decoupling: Refreshable Pretrained Transfer for Streaming Recommendation
KGD는 실시간 추천 시스템에서 지식과 기하학적 표현을 분리하여 4–12% 성능 향상과 1.75% GMV 증가를 달성한 프레임워크이다.
- #308MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations
MerchantBench는 365일간 지속적인 온라인 판매 시뮬레이션을 통해 LLM 에이전트의 장기 일관성(Long-Term Coherence)을 평가하는 벤치마크이다.
- #309JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion
JoyAI-Video-Edit는 실시간 오픈엔드 동영상 편집을 위한 16B 파라미터 자동회귀 확산 모델로, 30 FPS의 처리 속도를 달성한다.
- #310AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling
AURORA-LM은 연속 잠재 공간에서 텍스트 생성을 위한 새로운 확산 언어 모델로, 블록 인과 트랜스포머와 쿼리 기반 인코더-디코더를 결합하여 높은 정확도를 달성한다.
- #311InfiniSplat: Implicit Gaussian Decoding for Large-Baseline Monocular View Synthesis
InfiniSplat은 단일 이미지에서 표면 정렬된 3D 가우시안 표현을 생성하여 대규모 뷰포인트 변화에서도 안정적인 렌더링을 달성한다.
- #312Are the Financial Reasoning from LLMs Credible? A Real World Test over Long-Horizon Statements
LLM이 금융 분석에서 진정한 구조적 추론을 수행하는지, FinIndices 벤치마크를 통해 실질적인 테스트를 진행한 연구.
- #313MiniWorld: Democratizing the Training of Video World Models from Scratch
MiniWorld는 8-GPU 서버에서 단기간에 훈련 가능한, 스트리밍 비디오 월드 모델의 재현 가능한 기반 프레임워크이다.
- #314Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent
Video-DeepResearch는 비디오 기반 멀티모달 에이전트의 새로운 훈련-평가 프레임워크로, 64.0% 정확도를 달성하며 기존 모델을 상회한다.
- #315PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning
PCSD는 강화학습에서 토큰 수준의 지도 신뢰도를 지속적 일관성으로 추정하여 성능을 향상시키는 자기-디스틸레이션 방법이다.
- #316ARCHead: Activation-Metric Residual Correction for Large Language Model Output Heads
ARCHead는 LLM의 출력 헤드를 압축하는 기술로, BF16 저장 공간을 3.7–3.9배 줄이며 1.007의 상대 퍼플렉시티를 달성한다.
- #317Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation
STAMPlus는 다중 타겟 분할을 한 번의 비자동회귀 추론으로 수행하며, 성능과 추론 속도를 동시에 개선한 MLLM 기반 분할 모델이다.
- #318PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents
PAST-Bench는 개인 에이전트의 경험 기반 자기 개선 능력을 평가하고 Hermes+를 통해 개선 경로를 진단하는 벤치마크와 개선 프레임워크를 제시한다.
- #319LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models
LLaDA MoE v2는 23.5T 토큰으로 학습된 30B-A3B 확산 언어 모델로, Qwen3와 유사한 성능을 65% 적은 토큰으로 달성한다.
- #320OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models
OmniPack은 Omni-LLM에서 구조적 압축과 세미나틱 정제를 결합한 훈련 없이도 높은 효율성과 성능을 유지하는 토큰 압축 프레임워크이다.