- #1CosmoH2G: A Hand-to-Gripper Transfer Dataset and Baseline Method for Object Manipulation with Complex Spatial Movements
- #2Large Language Models to Enhance Bayesian Optimization
LLAMBO는 대형 언어 모델을 활용해 베이지안 최적화 성능을 향상시키는 모듈식 접근법이다.
- #3RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback
RL-VLM-F는 VLM 피드백을 활용해 텍스트와 시각 관측만으로 강화 학습 보상을 자동 생성하는 방법이다.
- #4GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation
GE-Act 2.0은 조작 데이터에서 처음부터 학습된 월드-액션 모델로, 30,000시간 데이터로 44.1% 성공률을 달성하며 OOD 성능과 행동 다양성 향상에 기여한다.
- #5LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models
LLaDA 1.5는 ELBO 기반의 Variance-Reduced Preference Optimization(VRPO)를 통해 수학, 코드, 정렬 작업에서 기존 모델 대비 1~4.7% 성능 향상.
- #6Demystify Mamba in Vision: A Linear Attention Perspective
Mamba는 선형 어텐션 트랜스포머와 유사한 구조를 가지며, 잊기 게이트와 블록 설계가 성능 향상에 핵심 역할을 한다.
- #7MapCoder: Multi-Agent Code Generation for Competitive Problem Solving
MapCoder는 인간 개발자와 유사한 4단계 프로세스를 모방한 멀티에이전트 프롬프팅을 통해 코드 생성 성능을 대폭 향상시킨다.
- #8Street Gaussians: Modeling Dynamic Urban Scenes with Gaussian Splatting
Street Gaussians는 3D 가우시안 포인트 클라우드를 기반으로 도시 거리 장면을 실시간 렌더링하는 새로운 표현 방식이다.
- #9VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos
VideoTree는 장시간 동영상의 LLM 추론을 위한 트리 기반의 적응적 표현 방식으로, EgoSchema에서 61.1%의 정확도를 달성한다.
- #10Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities
Audio Flamingo는 오디오 이해, 인-컨텍스트 학습, 다중 턴 대화 능력을 갖춘 새로운 오디오 언어 모델로, 다양한 벤치마크에서 최신 기록을 달성한다.
- #11Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs
RPG는 MLLM을 활용한 텍스트-이미지 생성/편집 프레임워크로, 복합적 텍스트 프롬프트 처리 능력을 향상시킨다.
- #12Diffusion Models Are Real-Time Game Engines
GameNGen은 DOOM 게임을 기반으로 TPU에서 20fps로 실시간 실행 가능한 신경망 기반 게임 엔진으로, 확장 가능한 시뮬레이션과 높은 시각 품질을 제공한다.
- #292SimpleMemVLA: A Simple but Effective Native-Video Memory for Vision-Language-Action Models
- #302NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness
- #305OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining
OpenWAM은 모듈화된 연구 스택을 통해 시스템적인 월드-액션 모델 사전학습을 구현한 오픈 프레임워크이다.
- #306Miles v0.1: Production-Level Post-Training
- #307SceneMosaic: Efficient and Diverse Simulation-Ready Scene Generation via Hybrid Agentic Layout Evolution
SceneMosaic는 이미지 기반 초기화와 VLM 에이전트를 통한 진화적 레이아웃 조정을 결합하여, 효율적이고 다양한 시뮬레이션 준비 3D 장면을 생성하는 하이브리드 프레임워크이다.
- #308AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing
AuK은 자연어와 오디오 컨텍스트를 통합한 인터페이스로 음성 생성 및 편집을 수행하는 오픈소스 기반 모델로, 4.5× 가속된 추론과 3.03억 개의 지시-오디오 인스턴스로 학습된다.
- #309Kalman Delta Networks: Uncertainty-aware Associative Memory
KDN은 불확실성을 추적하는 Kalman 필터 기반의 새로운 연관 기억 모델로, 기존 DeltaNet 대비 성능을 개선한다.
- #310Unlocking Lossless Speedups in LLMs via Discrete Diffusion
Uno는 확률 확산을 활용해 대형 언어 모델의 속도를 3배까지 향상시키는 새로운 구조를 제시한다.
- #311RoboSPA: Can VLA Models Go Beyond Simple Scenes and Short-Horizon Tasks?
RoboSPA는 VLA 모델의 공간적·절차적 추론 능력을 평가하기 위한 대규모 로봇 조작 벤치마크이다.
- #312Measuring Language Transfer in Robot Policies: Adding Greek to a Cosmos3 Vision-Language-Action Policy
로봇 정책에 그리스어를 추가할 때, 번역된 데이터만 사용해도 성능이 일부 개선되지만, 정확한 측정이 핵심 과제임을 밝혔다.
- #313TransNormal-2: Geometry-Grounded Rectified Flow with Edge-Aware Decoding for Precise Normal Estimation
TransNormal-2는 VAE 재구성 오류를 해결한 정밀 법선 추정 모델로, ClearGrasp에서 4.2°의 MAE 감소를 달성.
- #314Omni Interaction Agent Technical Report
- #315ReactVAU: A Slow-Fast Decoupled Framework for Streaming Video Anomaly Understanding
ReactVAU는 실시간 스트리밍 환경에서 비정상 행동을 감지하고 원인을 설명하는 Slow-Fast 분리 프레임워크이다.
- #316Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation
- #317DriveZero: End-to-End Driving Beyond Human Demonstrations
- #318Mask Forcing: Improving Autoregressive Video Diffusion Distillation via Dual-Noise Masking Rollout
- #319Marigold V2: Revisiting Diffusion Transformers for Monocular Depth Estimation
Marigold V2는 Qwen-Image-Edit를 기반으로 2단계 학습 프로토콜을 통해 단일 이미지에서 고해상도 깊이 맵을 생성하는 확산 변형기 기반 모델로, KITTI와 ETH3D에서 AbsRel 기준 16-26% 개선된 성능을 보인다.
- #320ENEAS: Embedding-guided Neural Ensemble for Adaptive Segmentation
ENEAS는 텍스트 프롬프트 기반의 인스턴스 추적과 의미적 탐지 문제를 해결하기 위한 신경망 앙상블 모델이다.