- #1PhysDreamer: Physics-Based Interaction with 3D Objects via Video Generation
PhysDreamer는 3D 객체에 물리 기반 상호작용을 부여하여 새로운 자극에 대한 현실적인 동작을 생성하는 시스템이다.
- #2FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving
FSDrive는 시공간적 Chain-of-Thought(CoT)를 활용해 자율주행 모델이 시각적으로 추론하도록 돕는 새로운 프레임워크이다.
- #3Agent Workflow Memory
AWM은 웹 탐색 작업에서 성능을 향상시키기 위해 반복적으로 사용되는 작업 흐름을 추출하고 이를 에이전트 메모리에 통합하는 방법이다.
- #5Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination
RA-Bench라는 새로운 벤치마크를 통해 AI 생성 영상의 탐지 실효성을 평가하고, 사회적 위기 상황에서의 탐지 난이도를 분석한다.
- #6WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models
WebVoyager는 실제 웹사이트와 상호작용하여 사용자 지시를 end-to-end로 처리하는 LMM 기반 웹 에이전트로, 59.1%의 태스크 성공률을 달성했다.
- #7SV3D: Novel Multi-view Synthesis and 3D Generation from a Single Image using Latent Video Diffusion
SV3D는 단일 이미지로부터 높은 해상도의 3D 객체 생성과 다각도 뷰 시너지스를 달성하는 라티언트 비디오 디퓨전 모델이다.
- #8Improving Online Algorithms via ML Predictions
머신러닝 예측을 활용한 온라인 알고리즘 개선을 위한 이론적 연구.
- #9MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention
MInference는 10배 가속화된 A100 GPU 기반 1M 토큰 프리필링을 위한 동적 희소 어텐션 기법이다.
- #10NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models
NaturalSpeech 3는 FVQ와 factorized diffusion 모델을 결합해 zero-shot 환경에서 자연스러운 음성을 생성하는 TTS 시스템이다.
- #11MLLM-as-a-Judge: Assessing Multimodal LLM-as-a-Judge with Vision-Language Benchmark
MLLM-as-a-Judge 벤치마크를 통해 MLLM의 판단 능력을 평가하고, 인간 기준과의 차이를 분석한다.
- #12Large Brain Model for Learning Generic Representations with Tremendous EEG Data in BCI
LaBraM은 2,500시간 이상의 EEG 데이터로 사전 학습한 대규모 뇌 신호 모델로, 다양한 BCI 태스크에서 기존 최고 성능을 초과한다.
- #220MobileMem: Learning from a Year of Mobile Experiences
MobileMem은 모바일 환경에서의 장기 기억 시스템을 평가하기 위한 벤치마크와 프레임워크로, 사용자의 일년 분량의 경험을 기반으로 구성된다.
- #305PRM-as-a-Judge 1.5: A Toolkit for Robot Process Assessment
PRM-as-a-Judge 1.5는 로봇 실행 과정을 정밀하게 평가하는 툴킷으로, 실패 측 진행, 회복, 성공 측 실행 품질을 측정한다.
- #306Claim-Level Reliability Assessment for Efficient Test-Time Reasoning
CLR은 테스트 시 계산 자원을 효율적으로 재할당하여 추론 정확도를 향상시키는 훈련 없는 프레임워크이다.
- #307Modular Cognitive Architecture Emerges in Large Language Models
LLM에서 인간 뇌와 유사한 모듈식 구조가 나타난다는 것을 실증적으로 밝힘.
- #308Self-Supervised Visual On-Policy Distillation
S²VOPD는 강화된 학습 신호를 생성하기 위해 학습자의 입력에 정보를 제거하는 방식으로, 특권 정보 없이도 정교한 시각 인식 성능을 향상시킨다.
- #309Marionette: Predicting World States, Rendering Geometry, Painting Appearance
Marionette는 3D 월드 상태를 예측하고 렌더링, 관찰을 분리하여 게임 세계 모델의 제어성과 일관성을 향상시킨다.
- #313CW-BASS v2: Saturation-Aware Pseudo-Label Selection for Semi-Supervised Segmentation under Foundation-Model Teachers
CW-BASS v2는 DINOv2와 같은 강력한 foundation 모델의 confidence saturation 현상을 고려한 pseudo-label 선택 방법이다.
- #314Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development
7개 최첨단 모델을 36개 장기 과제에서 평가하여, 현재 자율 에이전트가 연구자보다 공학 최적화에 더 가까운 성능을 보임을 밝힘.
- #315Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning
Mobius-v0는 지식 저장과 추론 계산을 분리한 아키텍처로, 4× 추론 가속과 62.6% 훈련 데이터 절감을 달성한다.
- #318SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning
SimpleOPD는 토크나이저 차이를 고려한 온-폴리시 디스틸레이션으로 수학 증명 능력을 전이시켜 모델 성능을 향상시킨다.
- #319Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence
Apodex Discovery는 실제 문제 해결을 위한 AI 평가 프레임워크로, AAV 캡시드 설계에서 기존 최고 성능을 7% 초과 달성.
- #320DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data
Mimir v1은 허가된 데이터만을 사용해 10억 파라미터 HRM 모델로, 영어 및 덴마크어 벤치마크에서 뛰어난 성능을 보인다.
- #321Amplified Does Not Mean Predictive: Reasoning Behaviors in Thinking Models
15개 모델을 대상으로 15,282개 추론 트레이스를 분석하여, 사고 훈련이 정확도와 강하게 연관된 행동을 증폭시키지 않는다는 사실을 밝힘.
- #322HumanTracker: Towards Comprehensive and Human-Aligned Motion Tracking Benchmark
HumanTracker는 인간의 인식과 일치하는 대규모 인간 모션 추적 벤치마크와 HumanScore라는 인간 선호도 기반 평가 지표를 제안한다.
- #323An AI4AI Framework for Visual Token Pruning
AutoPrune는 LLM 기반의 시각 토큰 정제 정책을 설계하는 AI4AI 프레임워크로, 94.4%의 토큰 제거에도 99% 이상의 성능을 유지한다.
- #324Maglev: Sliding Recurrent Memory
Maglev는 슬라이딩 윈도우 어텐션을 일반화하면서 추론 시 고정 메모리로 작동하는 반복 트랜스포머 구조를 제안한다.
- #325Thought-Level Beam Search for Reasoning
Gambit는 토큰 소비를 최대 68.5% 절감하면서도 AIME-25에서 +3.3%의 정확도 향상을 달성한 사고 수준 빔 서치 알고리즘입니다.
- #326SKILLER: Language-Level Reinforcement Learning for Reusable Skill Extraction in Small Language Models
SKILLER는 소형 언어 모델에 맞춤형으로 스킬을 생성하는 자연어 기반 강화 학습 프레임워크로, Qwen3.5-9B와 Qwen3.5-4B에서 기존 방법 대비 최대 20.4%의 성능 향상을 달성했다.
- #327Context-Matched Distillation: Teacher Causality for Autoregressive Video Distillation
Context-Matched Distillation(CMD)는 자율적 비디오 생성에서 교사-학생 간 정보 불일치를 해결하여 생성 품질과 제어 정확도를 향상시키는 인과적 지도 프레임워크이다.