- #1Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning
Open-AoE는 스마트폰으로 수집된 2,000시간의 제1인칭 조작 영상과 처리 파이프라인, 학습 도구를 제공하는 오픈 인프라이다.
- #2EvolvingWorld: An Open-Schema Framework for Co-Evolving Role-Play Agents and World Model in Interactive Literary World
EvolvingWorld는 인터랙티브 문학 세계에서 캐릭터와 세계가 공진화하도록 지원하는 오픈스키마 프레임워크와 벤치마크이다.
- #3ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU
ABot-World-0는 단일 데스크톱 GPU에서 실시간으로 장기적이고 일관된 인터랙티브 월드를 생성하는 행동 조건부 비디오 월드 모델이다.
- #5DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines
DataFlow-Harness는 LLM 기반 코드 에이전트가 편집 가능한 DAG 파이프라인을 생성하도록 돕는 플랫폼으로, 12개 태스크에서 93.3%의 종단간 성공률을 달성했다.
- #6Beyond Output-Space Calibration: Spectral Evidence Bundling for Selective Reliability Estimation in Time-Series Classification
SEB-Cal은 시간 시계열 분류에서 신뢰도와 스펙트럼 증거를 결합하여 선택적 신뢰성 추정을 개선하는 검증 게이트 기반 정책을 제안한다.
- #7AlayaWorld: Interactive Long-Horizon World Modeling -- Full Technical Report
AlayaWorld는 사용자 입력으로 인터랙티브하고 지속적으로 진화하는 가상 환경을 생성하는 15B 파라미터 비디오 디퓨전 트랜스포머 기반 모델이다.
- #8Apple-π: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence
Apple-π는 물리 법칙 기반의 비디오 생성 모델 평가를 위한 첫 번째 벤치마크로, 400개의 Orchid 데이터셋과 3단계 프로토콜을 통해 모델의 물리적 추론 능력을 진단한다.
- #9TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs
TimeLens2는 다양한 영상 조건에서 신뢰할 수 있는 시간 구간 추정을 수행하는 다중 모달 대형 언어 모델이다.
- #10EduPanel: A Three-Agent LLM Judge for Teaching Videos -- Reliability, Complementarity, and Human Trust Calibration
EduPanel은 학습자 조건에 따른 교육 영상 평가를 위한 3개 에이전트로 구성된 LLM 평가 시스템으로, 전문가 수준의 신뢰도와 보완성을 보인다.
- #11Masked Visual Actions for Unified World Modeling
Masked Visual Actions는 비디오 모델에 시각적 액션을 주입하여 로봇 월드 모델링을 통합하는 새로운 제어 인터페이스이다.
- #12DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment
DeepSearch-World는 검증 가능한 환경에서 자기 정제를 통해 웹 에이전트를 훈련하는 프레임워크이다.
- #13Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers
대규모 텍스트-이미지 디퓨전 트랜스포머(DiT)의 내부 메커니즘을 인과적 해석 프레임워크로 분석하고, 템플릿 토큰이 암묵적 의미 레지스터 역할을 한다는 사실을 밝힘.
- #14Generative World Renderer at the Speed of Play
AlayaRenderer-Flash는 G-buffer 기반 생성 모델을 실시간 렌더링으로 전환하여 0.56 FPS에서 31.54 FPS로 성능을 대폭 향상시킨다.
- #15HarmoHOI: Harmonizing Appearance and 3D Motion for Multi-view Hand-Object Interaction Synthesis
HarmoHOI는 2D 비디오와 전역 3D 운동을 통합 생성하는 다중 뷰 핸드-오브젝트 상호작용 합성 프레임워크이다.
- #16BearingNAS: Obtaining In-Sensor Intelligent Fault Diagnosis Systems for Bearings Using a Laptop
BearingNAS는 센서 내부에서 베어링 고장 진단을 수행하는 저비용 HW-NAS 프레임워크로, ISPU에서 99.50% 정확도를 달성한다.
- #17Dual-domain fused LSTM modeling for efficient time-dependent reliability analysis
DDF-LSTM 모델을 제안하여 시간 종속 신뢰도 분석의 계산 효율성과 예측 정확도를 동시에 향상시킨다.
- #18Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing
Mage-Flow는 4B 규모의 효율적인 이미지 생성 및 편집 기반 모델로, 고해상도 작업을 낮은 비용으로 가능하게 한다.
- #19HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enchancement
HOMIE는 인물-객체 중심 동영상 개인화 작업에서 MLLM과 VAE 토큰의 정확한 정렬을 달성한 통합 프레임워크로, GMG와 MRE 모듈을 통해 SOTA 성능을 보인다.
- #20GigaChat Audio: Time-aware Large Audio Language Model
GigaChat Audio는 최대 120분의 오디오 입력을 처리하며, 시간 기반 질문에 정확한 타임스탬프를 포함한 답변을 생성하는 시간 인식 대형 오디오 언어 모델이다.
- #21FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry
FlowMimic은 마스크 없이 영상 편집 및 생성을 가능하게 하는 픽셀-쌍 왜곡 흐름 필드를 제안하여 영상 편집 데이터 생성과 모달리티 모방을 실현한다.
- #22GigaAM Multilingual: Foundation Model for Underrepresented Languages
GigaAM Multilingual은 2M시간의 오디오로 사전 학습된 Conformer 인코더를 통해 중앙아시아 언어 ASR 성능을 크게 향상시킨다.
- #23Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning
비동기 강화학습의 안정성을 향상시키기 위해 staleness-적응형 신뢰영역(SAT)을 제안한다.
- #24ISO: An RLVR-Native Optimization Stack
ISO는 RLVR에서 가중치 스펙트럼을 고정하고 특이값 프레임만 최적화하는 새로운 최적화 프레임워크이다.
- #25ReflectWorld-MM: An Entity-Oriented Multimodal Memory System for Open-Ended Video Streams
ReflectWorld-MM은 개방형 동영상 스트림을 위한 엔티티 중심 다중 모달 메모리 시스템으로, 6개의 장시간 동영상 벤치마크에서 최고 정확도를 달성했다.
- #26AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents
AgentDebugX는 LLM 에이전트 실패를 추적·진단·복구하는 반복적 디버깅 프레임워크로, DeepDebug를 핵심으로 정확도와 복구 성능을 향상시킨다.