- #1PhysGen: Rigid-Body Physics-Grounded Image-to-Video Generation
PhysGen은 단일 이미지와 물리 조건을 입력으로 받아, 현실적이고 물리적으로 타당한 동영상을 생성하는 이미지-투-비디오 생성 시스템이다.
- #2MA-LMM: Memory-Augmented Large Multimodal Model for Long-Term Video Understanding
MA-LMM은 장기 동영상 이해를 위해 메모리 은행을 도입한 오프라인 방식의 대규모 멀티모달 모델이다.
- #3DepthSplat: Connecting Gaussian Splatting and Depth
DepthSplat은 Gaussian splatting과 depth estimation을 결합하여 ScanNet, RealEstate10K, DL3DV에서 최고 성능을 달성한 통합 모델이다.
- #4UltraEdit: Instruction-based Fine-Grained Image Editing at Scale
UltraEdit는 400만 개 이상의 자동 생성된 지시 기반 이미지 편집 샘플을 포함한 대규모 고질량 데이터셋으로, 기존 문제를 해결한 시스템적 생성 파이프라인을 제시한다.
- #5Recammaster: Camera-Controlled Generative Rendering From a Single Video
ReCamMaster는 단일 영상에서 카메라 제어를 통해 새로운 시점의 동영상을 생성하는 생성적 렌더링 프레임워크이다.
- #6VisionZip: Longer is Better but Not Necessary in Vision Language Models
VisionZip은 시각 토큰의 중복을 줄여 모델 성능을 유지하면서 추론 속도를 8× 향상시키는 간단한 방법이다.
- #7Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free
Gated Attention을 통해 SDPA 출력에 시그모이드 게이트를 적용한 결과, 모델 성능과 훈련 안정성이 향상되며 'attention sink' 현상을 제거할 수 있었다.
- #8TokenSkip: Controllable Chain-of-Thought Compression in LLMs
TokenSkip는 CoT 내 불필요 토큰을 선택적으로 건너뛰며 추론 효율성을 향상시키는 LLM 압축 기법이다.
- #9tinyBenchmarks: evaluating LLMs with fewer examples
tinyBenchmarks는 대형 언어 모델(LLM) 평가를 100개 미만의 예시로 정확히 재현할 수 있도록 설계된 도구와 축소된 벤치마크 데이터셋을 제공한다.
- #10DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads
DuoAttention은 LLM의 장문맥 추론에서 메모리와 계산 효율성을 극대화하기 위해 Retrieval Heads와 Streaming Heads를 구분하는 새로운 인퍼런스 프레임워크이다.
- #301HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?
HarnessDev는 LLM이 실행 인프라를 생성하고 개선하는 능력을 평가하는 벤치마크로, 생성 및 진화 단계에서 성능과 효율성을 측정한다.
- #302Compile by Training: Turning Natural-Language Specifications into Local Neural Functions
자연어 명세를 기반으로 로컬 신경망 함수를 생성하는 "Compile by Training" 방법을 제안한다.
- #303Aspire: Can Models Self-Evolve from Vague Goals?
ASPIRE는 모델이 명확한 목표 없이 모호한 능력 목표로부터 스스로 진화할 수 있는 벤치마크를 제시한다.
- #304Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments
Terminal-Universe는 기존 에이전트 트레이잭토리에서 실행 가능한 환경을 재구성하고 새로운 작업을 합성하여 터미널 기반 코드 에이전트의 학습을 확장하는 프레임워크이다.
- #305LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes
LLaDA-Image는 6B 규모의 DiT와 LLaDA2.0-Mini 기반 VLM을 결합한 오픈소스 이미지 생성 프레임워크로, 220M 샘플 중 98%가 실제 이미지이며 Qwen-Image-Bench에서 53.53 점을 달성했다.
- #306Knowing When Not to Reuse: Conditional Experience Transfer in Autonomous LLM Post-Training
BCIT는 자율적 사후 훈련에서 과거 경험의 조건부 재사용을 결정하는 문제를 해결하는 방법이다.
- #307Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning
Random Attention은 KV 캐시에서 무작위 추출을 통해 기존 선택 신호를 대체하면서도 성능을 유지하고 처리량을 32–43% 증가시킨다.
- #308LatentPress: Context Compression Beyond Text and Vision
LatentPress는 언어 모델이 텍스트 복원 없이 직접 읽을 수 있는 연속 메모리 토큰을 생성하여 대규모 컨텍스트를 압축하는 새로운 인터페이스를 제시한다.
- #309Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLM
Gated DeltaNet(GDN) 기반의 Qwen3.8-27B 모델을 NVFP4 W4A4로 전체 496개의 선형층을 4비트로 양자화하여 BF16 수준 성능을 달성한 연구.
- #310Rethinking On-Policy Distillation of Large Language Models II: One Training Example
단일 훈련 예시로도 대규모 언어 모델의 온-폴리시 디스틸레이션(OPD) 성능을 크게 회복할 수 있음을 밝힘.
- #311Puffin-World: Scaling a Unified Multimodal Model with Native 3D World States
Puffin-World는 물리, 기하, 외관을 통합한 3D 월드 생성 및 재구성을 위한 단일 프레임워크로, Omni-Camera와 Physics Propagation을 통해 물리적으로 일관되고 시각적으로 안정적인 월드 모델링을 실현한다.
- #312VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement
VeriPhy는 생성된 동영상의 물리적 일관성을 체계적으로 검증하는 시스템으로, 149개 클립에서 304개 결함 중 228개를 감지했다.
- #313RoboTok: An Internet-Scale Data Engine for Human Demonstration Retrieval and Dexterous Manipulation Learning
RoboTok은 인터넷 영상에서 인간 조작 동작을 추출해 로봇 정책 학습에 활용하는 대규모 데이터 엔진이다.
- #314SnapBench: Benchmarking Snap-and-Ask Multimodal Retrieval for Mobile Interactions
SnapBench는 모바일 환경에서 사진과 질문을 결합한 다중모달 검색의 안정성을 평가하는 최초의 페어형 벤치마크이다.
- #315Scal3R: Learning Efficient Multi-Relative Pose Query for Scalable Online 3D Reconstruction
Scal3R은 KITTI 데이터셋에서 평균 ATE를 60% 이상 개선하며, 1% 미만의 파라미터로 온라인 3D 재구성을 안정적으로 수행하는 다중 참조 상대 자세 쿼리 프레임워크이다.
- #316Editable Visual Design
"Editable Visual Design"은 코드 생성과 시각 생성 모델을 결합해 편집 가능한 디자인을 실현하는 새로운 패러다임이다.
- #317S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement?
S3Gym은 LLM이 자가 테스트, 판단, 개선을 통해 성능을 향상시킬 수 있는지 평가하는 대화형 벤치마크이다.
- #318WHALE: A Simple Recipe for Joint Harness-Weight Optimization
WHALE은 모델 가중치와 실행 가능한 헤이븐 코드를 번갈아 최적화함으로써 에이전트 성능을 향상시키는 모듈식 프레임워크이다.
- #319Beyond Visual Similarity: Entity-Aligned Retrieval for Knowledge-Based Visual Question Answering
KBMR은 KB-VQA에서 CLIP 기반 검색의 한계를 극복한 MLLM 기반 검색기로, 최대 14.7%의 Recall@1 개선을 달성했다.
- #320The Missing Temporal Link: Temporal Context Routing for Script-Driven Audio-Video Generation
TCR은 스크립트 기반 동영상 생성에서 비디오와 오디오의 타이밍을 스크립트와 정확히 맞추는 기술로, Shot Boundary MAE 96% 감소, Dialogue [email protected] 84.1% 달성.