- #1INSIDE: LLMs' Internal States Retain the Power of Hallucination Detection
- #2Transolver: A Fast Transformer Solver for PDEs on General Geometries
- #3WebThinker: Empowering Large Reasoning Models with Deep Research Capability
- #4Latent Action Pretraining from Videos
- #5JudgeBench: A Benchmark for Evaluating LLM-based Judges
JudgeBench는 LLM 기반 심사자 평가를 위한 새로운 벤치마크로, 기존 평가 기준보다 훨씬 어려운 과제를 제시한다.
- #6WorkArena: How Capable Are Web Agents at Solving Common Knowledge Work Tasks?
- #7One-Step Effective Diffusion Network for Real-World Image Super-Resolution
- #8Diffusion for World Modeling: Visual Details Matter in Atari
- #9Navigation World Models
- #10TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies
- #12HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone
- #252Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model
- #303Kimi K3: Open Frontier Intelligence
Kimi K3는 2.8T 파라미터 MoE 모델로, Kimi K2 대비 2.5배 향상된 확장 효율성을 보인다.
- #304Wonder: Video World Model Done Better
- #306Temporal-Distance JEPA: Plan-Aware Representation Learning for Latent World Model Predictive Control
- #307PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models
- #308The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation
다중 턴 장기 계획 능력을 구조화된 환경에서 3단계로 분석하고, MOPD를 통해 통합하는 방법을 제시한다.
- #309JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents
JarvisHub는 캔버스 기반의 창의적 에이전트 허브로, 장기적 멀티모달 창작 과정을 관리하고 추적 가능하게 만든다.
- #310A New Role for Relevance: Guiding Corpus Interaction in Agentic Search
- #311Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation
On-policy diffusion distillation에서 classifier-free guidance 조건 하의 지도 효과를 개선하기 위해 Positive–Direction Matching(PDM)을 제안한다.
- #312ReDesign: Recovering Editable Design Structures from Images via Agentic Decomposition
- #313VisualPatchWorld: Code World Models as Latent Structured Representations for Planning
- #314Codifying the Judge: Scalable Evaluation via Program Distillation
PAJAMA는 LLM 평가를 프로그램으로 변환하여 비용, 속도, 투명성을 동시에 개선하는 새로운 평가 프레임워크이다.
- #315Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification
Sol-Attn은 비용 효율적인 동적 어텐션 스파스화를 통해 동영상 생성 추론 속도를 2.1~2.3배 향상시킨다.
- #316Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On
Oxygen-TryOn은 다양한 의류와 액세서리를 포함한 항목을 정밀하게 시뮬레이션하는 통합 가상 시착 모델로, 기존 시스템보다 뛰어난 일관성과 사실감을 보인다.
- #317CodeNib: A Multi-View Data System for Serving Repository Context to Coding Agents
- #318Keep It InMind: Benchmarking the Implicit-Association Blind Spot in Agent Memory
- #319Pass the Baton: Trajectory-Relayed On-Policy Distillation
- #320Novel Claim or Déjà Vu? Rethinking "Contamination-Free'' Dynamic Evaluation for Multimodal Automated Fact-Checking
- #321Shieldstral