- #1World Model on Million-Length Video And Language With Blockwise RingAttention
1M 토큰 길이의 언어 및 비디오-언어 모델을 구축하고, Blockwise RingAttention을 기반으로 확장성을 보장한 오픈소스 구현을 제시한다.
- #2Towards a Densing Law for User Representation Learning at Billion-Scale Capacity
유저 행동 데이터의 밀도 기반 토큰화 법칙(User Behavioral Densing Law)을 제안하고, ALGN이라는 적응형 토큰화 방법으로 대규모 유저 표현 학습 성능을 향상시킨다.
- #3BLOCK DIFFUSION: INTERPOLATING BETWEEN AU-TOREGRESSIVE AND DIFFUSION LANGUAGE MODELS
BLOCK DIFFUSION은 확산 모델과 오토회귀 모델의 장점을 결합한 언어 모델로, 가변 길이 생성과 향상된 퍼플렉시티를 달성한다.
- #4DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving
DiffusionDrive는 2단계의 truncated diffusion policy와 cascade decoder를 통해 실시간 자율주행 성능을 45 FPS, PDMS 88.1로 달성한 모델이다.
- #5EAGLE-2: Faster Inference of Language Models with Dynamic Draft Trees
EAGLE-2는 EAGLE 기반으로, 컨텍스트에 따라 동적으로 드래프트 트리 구조를 조정하여 최대 5배의 속도 향상을 달성한 lossless 추론 가속 알고리즘이다.
- #6GRM: Large Gaussian Reconstruction Model for Efficient 3D Reconstruction and Generation
GRM은 0.1초 이내에 3D 자산을 복원하는 3D Gaussian 기반의 대규모 생성 모델이다.
- #7EMCAD: Efficient Multi-Scale Convolutional Attention Decoding for Medical Image Segmentation
EMCAD는 의료 이미지 분할에서 성능과 계산 효율성을 동시에 최적화한 다중 스케일 컨볼루션 어텐션 디코더로, 12개 데이터셋에서 기존 방법 대비 79.4%의 파라미터 감소를 달성했다.
- #8DNGaussian: Optimizing Sparse-View 3D Gaussian Radiance Fields with Global-Local Depth Normalization
DNGaussian은 3D Gaussian Splatting 기반으로, 25× 훈련 시간 감소와 3000× 빠른 렌더링 속도를 달성한 저비용 높은 품질의 few-shot 뉴럴 라이트 필드 프레임워크이다.
- #9The Effect of Sampling Temperature on Problem Solving in Large Language Models
LLM에서 샘플링 템퍼러처가 문제 해결 성능에 통계적으로 유의미한 영향을 미치지 않는다는 것을 실증적으로 밝혔다.
- #10Generative Flows on Discrete State-Spaces: Enabling Multimodal Flows with Applications to Protein Co-Design
Discrete Flow Models(DFMs)를 제안하여, 연속과 이산 데이터를 결합한 다중모달 생성 모델을 구축하고 단백질 공설계에 적용한다.
- #11Scaling Up to Excellence: Practicing Model Scaling for Photo-Realistic Image Restoration In the Wild
SUPIR는 2000만 장의 고해상도 이미지와 텍스트 데이터를 기반으로, 텍스트 프롬프트와 생성 모델 스케일링을 활용한 초고품질 이미지 복원 모델이다.
- #288GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture
GigaBrain-0.7는 37,000시간 이상의 이질적 로봇 데이터로 사전 학습한 3시스템 아키텍처 기반의 VLA 모델로, 다양한 로봇 형태에서의 제로샷 성능과 작업 성공률을 대폭 향상시킨다.
- #292EchoWM: Open and Enterable Omnimodal World Models
EchoWM은 720p 영상, 환경음, 음악, 음성을 동시 생성하며, 1인칭 및 3인칭 시점의 연속 이동에 반응하는 옴니모달 월드 모델이다.
- #298One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows
Thinkingbox는 상태 기반 비즈니스 워크플로우에서 에이전트의 신뢰성 평가를 위한 샌드박스와 벤치마크를 제시한다.
- #303DriftAD: Visually-Guided Text Drift for Few-Shot Industrial Anomaly Detection
DriftAD는 CLIP 기반의 시각-언어 모델을 활용한 소량 샘플 산업 이상 탐지에서 정확도를 향상시키는 시각적으로 유도된 텍스트 드리프트 기법을 제안한다.
- #306Game2World Engine: Unlocking In-the-Wild Gameplay Videos for World Model Training
게임 플레이 영상에서 UI를 제거해 월드 모델 학습 데이터를 생성하는 Game2World 엔진과 GameCleaner 모델을 제안한다.
- #307MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World Tasks
MobilePA-Bench는 모바일 환경에서 LLM 에이전트의 도구 사용 및 계획 능력을 종합적으로 평가하는 대규모 벤치마크이다.
- #308SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation
SecOPD는 토큰 수준 피드백을 통해 적응형 프롬프트 주입 공격에 대응하는 방식으로 Qwen3.6-27B 모델의 공격 성공률을 94.0%에서 9.0%로 낮춘다.
- #309Industrial-Instruction: An End-to-End Framework for Building Instruction-Tuning and Benchmark Datasets from Industrial Technical Reports
Industrial-Instruction은 산업 기술 보고서를 기반으로 QA 데이터셋과 생성 파이프라인을 제공하여 산업 벤치마크 및 훈련 데이터를 구축하는 실용적이고 재현 가능한 방법을 제시한다.
- #310Tomatoes, Potatoes, and Onions: Questioning the Need for Faces in Face Presentation Attack Detection
토마토, 감자, 마늘을 사용한 무표현 얼굴 PAD 데이터셋 TPO를 통해 얼굴 정보 없이도 높은 성능의 PAD가 가능함을 실증.
- #311Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs
OraRL은 비디오 MLLM의 강화학습 후처리를 효율화하고 확장 가능한 새로운 프레임워크로, 어노테이션을 직접 오라클로 활용하여 성능을 66.0~78.2%까지 향상시킨다.
- #312WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report
WeMM-Embedding은 2B, 4B, 9B 규모의 다중 모달 임베딩 모델로, MMEB-v2에서 80.6 점을 달성하며 실무 성능도 입증했다.
- #313AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces
AutoSaddler는 LLM 에이전트의 장기적 작업 성능을 자동 개선하는 하네스 최적화 프레임워크로, 실패 트레이스를 기반으로 지속적인 업데이트를 수행한다.
- #314On-Policy Self-Distillation in Diffusion Models
DiffusionOPSD는 확산 모델의 포스트 트레이닝을 효율적으로 수행하기 위한 온-포로이 자기-디스틸레이션 프레임워크이다.
- #315Unlocking the Potential of Image Editing via Concept Scaling and Dense Supervision
이미지 편집 모델의 성능을 향상시키기 위해 개념 세분화와 밀집된 지도 학습 전략을 제안하며, ConceptEdit-12M 데이터셋과 ConceptEdit-Bench 평가 도구를 제시한다.
- #316AgentRoom: Concurrent Multi-Agent Coding in a CRDT-Backed Shared Workspace
AgentRoom은 CRDT 기반 공유 워크스페이스에서 동시 다중 에이전트가 협업하는 실시간 프로토콜로, 파일 수준 클레임과 브로드캐스트를 통해 협업 실패를 억제한다.
- #317Automata from Agent Traces: Failure and Next-Step Prediction
LLM 에이전트의 실행 트레이스를 기반으로 생성된 FSM이 다음 단계 예측과 실패 예측 성능을 동시에 향상시킨다.
- #318The Mask Is Not the Model: Auditing Prefix Invariance in Attention, State-Space, and Hybrid Sequence Models
전향 마스크 검사가 누설을 누락하는 이유를 규명하고, 새로운 인과성 검증 방법을 제시한다.
- #319CyberFactory: Scaling Cyber Security Capabilities with Instances from the Wild
CyberFactory는 오픈소스 보안 모델 OpenAegis를 훈련하기 위한 통합 프레임워크로, 58.1% Pass@1 성능을 기록했다.
- #320Block3D: Efficient Text-to-3D Generation via Block-Wise Diffusion
Block3D는 블록 단위 확산을 통해 텍스트-3D 생성 속도를 5.15배 향상시키며 기하학적 정확도를 유지한다.