- #1End-to-End Driving with Online Trajectory Evaluation via BEV World Model
WoTE는 BEV 월드 모델을 활용해 미래 상태를 예측하는 실시간 운전 경로 평가 프레임워크로, NAVSIM 및 Bench2Drive 벤치마크에서 최고 성능을 달성했다.
- #2ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning
ThinkAct는 강화 학습 기반의 시각 잠재 계획을 통해 시각-언어-행동(VLA) 추론을 구현하는 이중 시스템 프레임워크이다.
- #3Implicit Style-Content Separation using B-LoRA
B-LoRA를 통해 단일 이미지에서 스타일과 콘텐츠를 암시적으로 분리하여 다양한 이미지 스타일화 작업을 가능하게 한다.
- #6Logit Standardization in Knowledge Distillation
로짓 표준화를 통해 지식 증류 성능을 향상시키는 새로운 전처리 방법을 제안한다.
- #7AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning
AReaL은 대규모 언어 모델의 강화 학습을 위한 비동기식 시스템으로, 동기식 시스템 대비 최대 2.77×의 학습 가속을 달성한다.
- #8Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding
Video-XL은 VST 모듈을 활용해 16× 압축에서도 높은 정확도를 유지하는 장시간 동영상 이해 모델이다.
- #9SplattingAvatar: Realistic Real-Time Human Avatars With Mesh-Embedded Gaussian Splatting
SplattingAvatar는 삼각형 메시에 임베딩된 가우시안 스플래팅을 활용해 300 FPS 이상의 실시간 렌더링이 가능한 고해상도 인간 아바타를 제시한다.
- #10OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLM
OmniMedVQA는 73개 의료 데이터셋을 기반으로 구성된 대규모 의료 VQA 벤치마크로, LVLM의 의료 분야 성능 평가에 기여한다.
- #11StreamingT2V: Consistent, Dynamic, and Extendable Long Video Generation from Text
StreamingT2V는 CAM과 APM을 통해 2분 이상의 일관성 있는 장시간 동영상 생성을 가능하게 하는 텍스트-투-비디오 확산 모델이다.
- #12The Unreasonable Ineffectiveness of the Deeper Layers
LLM의 더 깊은 레이어가 지식 저장에 기여하지 않는다는 사실을 레이어 프루닝과 QLoRA를 통해 입증.
- #298Physics-Informed Conformal Prediction: Embedding PDE Consistency into Distribution-Free Uncertainty Quantification for Neural Operators
물리학 정보를 통합한 확률적 예측 구조인 PI-CP를 제안하여 PDE 해석 모델의 불확실성을 분포와 무관하게 정량화한다.
- #309SNAP3D: Physically Grounded 3D Parts for Assembly from a Single Image
- #310DataFlex-RL: An Evaluation Platform for RLVR Data Policies
- #311Feyospace-v1: How the Cyber Mercury Seven Trained Frontier Cyber Models
- #312Benchmark Radar: A Living Database and Search Engine for AI Benchmarks and Evaluation
- #313Breaking the Vision-Action Shortcut: Latent Interface Training for Generalizable Robotics Foundation Models
- #316Robust Prototypical Networks for Few-Shot Sensor Fault Diagnosis
- #317Fundamental Dynamical Units for Physics-Informed Structural Inference from Perturbation Time-Series in Networked Systems
FDU(Fundamental Dynamical Units)를 도입하여 네트워크 동역학 시스템의 구조를 물리 기반 신경 ODE와 결합한 인과 추론 프레임워크를 제안한다.
- #318Spectral Consistency-Guided Multiview Point Cloud Registration for Low-Overlap Scenes
- #319SAS: Simple Attention Sparsification via End-to-End Optimization of Context Ranking
- #326Beyond Solver Verdicts: Generative Reward Models for Autoformalization
GenV+HN은 Z3 기반 오프라인 검증 정보를 활용해 참조-동등성을 검증하는 생성적 검증 모델로, 0.961 AUROC 성능을 달성하고 11.3포인트의 정확도 향상을 유도한다.
- #328COBRA-Skills: Contextual Bandit-Guided Evolution for Agent Skill Optimization
- #329StepAudio 3 Gen Technical Report
- #333Building Multilingual Bridges: Data Mixing as the Pillar of Generalization for In-Language Reasoning
3.35B 규모의 Tiny Aya L2-Thinker 모델을 통해 60개 언어에서 93% 이상의 L2 추론률을 달성하며, 다국어 추론 성능을 확장하는 데이터 중심 접근법을 제시한다.
- #334Generative Late-Interaction Embeddings For Visual Document Retrieval
GLIE는 저장 공간 효율성을 유지하면서도 정확도를 보존하는 새로운 후처리 기반의 시각 문서 검색 방법이다.
- #335UniH^3: Unifying Hierarchical Homogeneity and Heterogeneity for All-in-One Medical Image Restoration
UniH3는 의료 이미지 복원의 다중 태스크와 모달리티를 통합하는 새로운 프레임워크로, 계층적 동질성과 이질성을 동시에 모델링한다.
- #336CARDEA: Auditable Reasoning Grounded in Spatial Evidence for End-to-End Coronary Angiography Interpretation
CARDEA는 강력한 시각-언어 모델과 Chain-of-Box 추론을 결합해 치료 결정을 지지하는 체계적 CAG 해석 파이프라인을 제공한다.
- #337PLC-DPO: Posterior Label Correction in Noisy and Ambiguous Preference Optimization
- #338Adaptive Bridge: A Proxy-Based Decoupling Layer for Mitigating DDS Backpressure in ROS 2
Adaptive Bridge는 ROS 2의 DDS 백프레셔 문제를 해결하기 위해 주요 구독자를 분리하는 프록시 기반 레이어를 제안한다.
- #339ActReview: Rebuttal-Guided Training Data and Rubric Rewards for Actionable Peer Review Generation
ActReview는 저자 반박을 활용한 행동 가능한 피어 리뷰 생성을 위한 후-트레이닝 프레임워크로, 진단 생성과 수정 제안 생성을 구조화하여 리뷰 품질을 향상시킨다.