- #1Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning
Open-AoE는 스마트폰으로 수집된 2,000시간의 제1인칭 조작 영상과 처리 파이프라인, 학습 도구를 제공하는 오픈 인프라이다.
- #2EvolvingWorld: An Open-Schema Framework for Co-Evolving Role-Play Agents and World Model in Interactive Literary World
EvolvingWorld는 인터랙티브 문학 세계에서 캐릭터와 세계가 공진화하도록 지원하는 오픈스키마 프레임워크와 벤치마크이다.
- #3Group Entropy-Controlled Policy Optimization
GEPO는 GRPO를 확장한 그룹 기반 정책 최적화 알고리즘으로, 이질적 태스크의 탐색-활용 균형을 개선한다.
- #4Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories
Xiaomi-Robotics-1은 10만 시간 이상의 실제 조작 데이터로 학습한 VLA 모델로, RoboCasa365에서 57.6% 성공률을 달성했다.
- #5Apple-π: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence
Apple-π는 물리 법칙 기반의 비디오 생성 모델 평가를 위한 첫 번째 벤치마크로, 400개의 Orchid 데이터셋과 3단계 프로토콜을 통해 모델의 물리적 추론 능력을 진단한다.
- #6RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model
RynnBrain 1.1은 2B, 9B, 122B-A10B 규모의 신형 탐지-이해-작업 통합 모델로, 3D 정착 및 접촉점 예측을 통해 로봇 조작 성능을 향상시킨다.
- #7TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs
TimeLens2는 다양한 영상 조건에서 신뢰할 수 있는 시간 구간 추정을 수행하는 다중 모달 대형 언어 모델이다.
- #8RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources
RESOURCE2SKILL은 멀티모달 자료를 실행 가능한 에이전트 스킬로 추출하는 프레임워크로, 7개 도메인에서 평균 +11.9% 성능 향상을 보인다.
- #9RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM
RAGU는 다단계 그래프 기반 RAG 엔진으로, Meno-Lite-0.1이라는 7B 언어 기술 최적화 모델을 통해 그래프 추출 정확도를 12.5% 개선한다.
- #10DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment
DeepSearch-World는 검증 가능한 환경에서 자기 정제를 통해 웹 에이전트를 훈련하는 프레임워크이다.
- #11SWE-Pruner Pro: The Coder LLM Already Knows What to Prune
SWE-Pruner Pro는 코드 생성 에이전트 내부 표현을 활용해 툴 출력을 직접 줄이며, 토큰 소비를 최대 39% 절감하고 성능을 유지한다.
- #12Partially Correlated Verifier Cascades in LLM Harnesses: Concave Log-Odds, Polynomial Reliability, and Blind-Spot Ceilings
LLM 검증 게이트의 부분적 상관성을 수학적으로 모델링하여, 신뢰도의 폴리노미얼 감소와 상한선을 정량화한다.
- #13RobustMAD: Evaluating Real-World Robustness of Multimodal Small Language Models for Deployable Anomaly Detection Assistants
RobustMAD는 산업 현장에서 사용 가능한 MSLM의 실무적 안정성을 평가하기 위한 첫 번째 벤치마크로, GPT-5 Nano를 초과하는 성능을 보이지만 여전히 안전 기준 미달.
- #14HarmoHOI: Harmonizing Appearance and 3D Motion for Multi-view Hand-Object Interaction Synthesis
HarmoHOI는 2D 비디오와 전역 3D 운동을 통합 생성하는 다중 뷰 핸드-오브젝트 상호작용 합성 프레임워크이다.
- #15HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enchancement
HOMIE는 인물-객체 중심 동영상 개인화 작업에서 MLLM과 VAE 토큰의 정확한 정렬을 달성한 통합 프레임워크로, GMG와 MRE 모듈을 통해 SOTA 성능을 보인다.
- #16GigaChat Audio: Time-aware Large Audio Language Model
GigaChat Audio는 최대 120분의 오디오 입력을 처리하며, 시간 기반 질문에 정확한 타임스탬프를 포함한 답변을 생성하는 시간 인식 대형 오디오 언어 모델이다.
- #17GigaAM Multilingual: Foundation Model for Underrepresented Languages
GigaAM Multilingual은 2M시간의 오디오로 사전 학습된 Conformer 인코더를 통해 중앙아시아 언어 ASR 성능을 크게 향상시킨다.
- #18ReflectWorld-MM: An Entity-Oriented Multimodal Memory System for Open-Ended Video Streams
ReflectWorld-MM은 개방형 동영상 스트림을 위한 엔티티 중심 다중 모달 메모리 시스템으로, 6개의 장시간 동영상 벤치마크에서 최고 정확도를 달성했다.
- #19FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry
FlowMimic은 마스크 없이 영상 편집 및 생성을 가능하게 하는 픽셀-쌍 왜곡 흐름 필드를 제안하여 영상 편집 데이터 생성과 모달리티 모방을 실현한다.
- #20REBASE: Reference-Background Subspace Elimination for Training-Free In-Context Segmentation
REBASE는 훈련 없이 배경 특성 공간을 제거하여 단일 참조 이미지로 쿼리 이미지의 세그멘테이션 성능을 향상시키는 새로운 인-컨텍스트 세그멘테이션 프레임워크이다.
- #21Qwen-Music Technical Report
Qwen-Music은 텍스트와 레퍼런스 음악 기반으로 고음질 음악을 생성하는 대규모 음악 생성 모델로, Melody-CoT와 Qwen-Music-Render를 통해 창의성과 음향 품질을 동시에 향상시킨다.
- #22ReViV: Reconstructing the Viewer and the View in 4D from Monocular Egocentric Video
ReViV는 단일 모노카메라 영상에서 시청자와 환경의 4D 재구성을 동시에 수행하는 통합 프레임워크로, 다양한 벤치마크에서 최고 성능을 달성한다.
- #23Environment-free Synthetic Data Generation for API-Calling Agents
LLM을 활용한 API 호출 에이전트 학습용 환경 없는 합성 데이터 생성 방법 제시.
- #24When Does Muon Help Agentic Reinforcement Learning?
Muon이 GiGPO 기반의 장기적 희소보상 에이전트 강화학습에서 AdamW 대비 88% 성능 향상을 보인다.
- #25Do Language Models Dream of Binding Molecules? Benchmarking LLMs under Spatial Constraints
LLM이 공간 제약 조건 하에서 분자 생성 능력을 평가하는 벤치마크 3D-Fit을 제안하고 분석한다.