- #1ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU
ABot-World-0는 단일 데스크톱 GPU에서 실시간으로 장기적이고 일관된 인터랙티브 월드를 생성하는 행동 조건부 비디오 월드 모델이다.
- #3Beyond Relevance-Centric Retrieval: Rubric-Oriented Document Set Selection and Ranking
Rubric4Setwise는 문서 집합의 질을 다차원적으로 평가하고 이를 기반으로 최적의 문서 선택을 수행하여 생성 성능을 향상시키는 훈련 없이 작동하는 시스템이다.
- #4DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines
DataFlow-Harness는 LLM 기반 코드 에이전트가 편집 가능한 DAG 파이프라인을 생성하도록 돕는 플랫폼으로, 12개 태스크에서 93.3%의 종단간 성공률을 달성했다.
- #5AlayaWorld: Interactive Long-Horizon World Modeling -- Full Technical Report
AlayaWorld는 사용자 입력으로 인터랙티브하고 지속적으로 진화하는 가상 환경을 생성하는 15B 파라미터 비디오 디퓨전 트랜스포머 기반 모델이다.
- #6Scaling Laws for Hypernetwork-Based Knowledge Injection in Large Language Models
하이퍼네트워크 기반 지식 주입이 대규모 언어 모델에서 예측 가능한 스케일링 법칙과 우수한 OOD 일반화를 보인다.
- #7Masked Visual Actions for Unified World Modeling
Masked Visual Actions는 비디오 모델에 시각적 액션을 주입하여 로봇 월드 모델링을 통합하는 새로운 제어 인터페이스이다.
- #8EduPanel: A Three-Agent LLM Judge for Teaching Videos -- Reliability, Complementarity, and Human Trust Calibration
EduPanel은 학습자 조건에 따른 교육 영상 평가를 위한 3개 에이전트로 구성된 LLM 평가 시스템으로, 전문가 수준의 신뢰도와 보완성을 보인다.
- #9Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers
대규모 텍스트-이미지 디퓨전 트랜스포머(DiT)의 내부 메커니즘을 인과적 해석 프레임워크로 분석하고, 템플릿 토큰이 암묵적 의미 레지스터 역할을 한다는 사실을 밝힘.
- #10Generative World Renderer at the Speed of Play
AlayaRenderer-Flash는 G-buffer 기반 생성 모델을 실시간 렌더링으로 전환하여 0.56 FPS에서 31.54 FPS로 성능을 대폭 향상시킨다.
- #11Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment
Anchor-Align는 VLA 미세조정 시 사전 학습된 표현을 보존하고 언어-작동 정렬을 강화하여 실제 로봇 성능을 28%에서 54%까지 향상시킨다.
- #12Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing
Mage-Flow는 4B 규모의 효율적인 이미지 생성 및 편집 기반 모델로, 고해상도 작업을 낮은 비용으로 가능하게 한다.
- #13CruiseBench: A Real-Flight-Aligned N-CMAPSS Benchmark for Engine RUL Prediction
CruiseBench는 N-CMAPSS 기반으로 항공기 엔진 RUL 예측을 위한 크루즈 단계 중심의 재현 가능한 벤치마크 프로토콜을 제시한다.
- #14SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD
Ascend NPU 기반으로 DeepSeek-V4 모델의 트릴리언-파라미터 포스트 트레이닝을 최적화한 SLAI T-Rex 프레임워크를 제시한다.
- #15Subliminal Clocks: Latent Time Modelling in Diffusion Language Models
DLMs가 잔여 스트림 내에서 확산 단계 정보를 내재적으로 인코딩하고 이를 제어할 수 있음을 밝힘.
- #16ISO: An RLVR-Native Optimization Stack
ISO는 RLVR에서 가중치 스펙트럼을 고정하고 특이값 프레임만 최적화하는 새로운 최적화 프레임워크이다.
- #17Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning
비동기 강화학습의 안정성을 향상시키기 위해 staleness-적응형 신뢰영역(SAT)을 제안한다.
- #18Self Gradient Forcing: Native Long Video Extrapolation
Self Gradient Forcing(SGF)는 자동 회귀 비디오 생성에서 역사적 컨텍스트의 학습을 강화하여 장시간 비디오 외삽을 향상시키는 2단계 훈련 전략이다.
- #19DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations
DocOps는 문서 조작 능력을 평가하는 검증 가능한 벤치마크 프레임워크이다.
- #20AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents
AgentDebugX는 LLM 에이전트 실패를 추적·진단·복구하는 반복적 디버깅 프레임워크로, DeepDebug를 핵심으로 정확도와 복구 성능을 향상시킨다.
- #21SciForma: Structure-Faithful Generation of Scientific Diagrams
SciForma는 과학적 방법론 다이어그램의 구조적 정확도를 보장하기 위해 Component, Arrow, Text 3축을 분해하고 M-DPO 알고리즘을 도입한 새로운 프레임워크이다.
- #22SLPO: Scaling Latent Reasoning via a Surrogate Policy
SLPO는 연속적인 잠재 추론을 강화 학습을 통해 향상시키는 새로운 정책 최적화 방법이다.
- #23An Exam for Active Observers
ActiveVision 벤치마크를 통해 MLLMs가 활성 시각 관찰 능력을 갖추지 못함을 실증적으로 밝힘.
- #24NexForge: Scaling Agent Capabilities through Requirement-Driven Task Synthesis for LLMs
NexForge는 요구사항 기반의 작업 합성 프레임워크로, LLM 에이전트의 능력을 확장하여 기존 베이스라인을 크게 상회하는 성능을 달성한다.
- #25When JSON Is Not Enough: Semantic Reliability of Schema-Constrained LLM Ordering Agents
LLM 에이전트의 JSON 스키마 준수는 의미적 신뢰도를 보장하지 못하며, 도메인 검증이 필수적임을 실증한 연구.
- #26Scale-Aware Learning of Chaotic Dynamics on Unstructured Meshes via Binned Spectral Losses
비구조화 메시에서 혼돈 역학을 학습하기 위해 그래프 스펙트럼 손실을 확장하여 장기 예측 정확도를 향상시킨다.