- #1DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation
DreamX-Phi 1.0은 언어 지시와 로봇 동작을 조건으로 미래 장면을 예측하는 조건부 영상 월드 모델로, WorldArena 2.0에서 Track 1 1위, Track 2 2위를 달성했다.
- #2MambaAD: Exploring State Space Models for Multi-class Unsupervised Anomaly Detection
MambaAD는 Mamba 기반 디코더와 LSS 모듈을 결합해 다중 클래스 비지도 이상 탐지에서 최첨단 성능을 달성한 모델이다.
- #3H2R-Bench: Benchmarking Human-to-Robot Manipulation Video Generation in World Models
H2R-Bench는 인간 조작 영상을 로봇 중심 조작 영상으로 전환하는 능력을 평가하는 벤치마크로, 6개 조작 유형과 2개 로봇 구조에서 11개 모델을 평가한다.
- #4MambaVision: A Hybrid Mamba-Transformer Vision Backbone
MambaVision은 시각 작업에 최적화된 하이브리드 Mamba-Transformer 백본으로, ImageNet-1K에서 최신 성능을 달성한다.
- #5Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention
NSA는 하드웨어 최적화와 끝에서 끝까지 학습 가능한 희소 어텐션 구조를 통해 64k 길이의 시퀀스에서 1.6× 이상 가속화된 효율적인 롱컨텍스트 모델링을 실현한다.
- #6CAT3D: Create Anything in 3D with Multi-View Diffusion Models
CAT3D는 멀티뷰 디퓨전 모델을 활용해 3D 장면을 1분 이내에 생성하는 시스템으로, 단일 이미지나 텍스트 입력에서도 높은 일관성을 보인다.
- #7UniDepth: Universal Monocular Metric Depth Estimation
UniDepth는 단일 이미지로 도메인 간 메트릭 3D 깊이를 추정하는 최초의 유니버설 모델로, 10개 데이터셋에서 제로샷 성능을 기록했다.
- #8Video-R1: Reinforcing Video Reasoning in MLLMs
Video-R1은 MLLM에서 비디오 추론 능력을 강화하기 위해 T-GRPO 알고리즘과 Video-R1-260k 데이터셋을 도입한 첫 시스템적 연구이다.
- #9Mixture-of-Agents Enhances Large Language Model Capabilities
다중 대형 언어 모델(LLM)의 협업을 통해 생성 품질을 향상시키는 Mixture-of-Agents(MoA) 프레임워크를 제안하고, AlpacaEval 2.0에서 65.1%의 성능을 달성한다.
- #10Safety Alignment Should Be Made More Than Just a Few Tokens Deep
현재 대형 언어 모델의 안전 정렬은 첫 몇 개의 토큰만 고려하는 "얕은 안전 정렬"로 인해 취약하다.
- #11ShareGPT4Video: Improving Video Understanding and Generation with Better Captions
ShareGPT4Video는 GPT4V와 자체 개발된 Differential Sliding-Window Captioning을 기반으로 40K 고질량 영상-캡션 데이터와 4.8M 캡션을 생성하여 영상 이해 및 생성 모델 성능을 향상시킨다.
- #12InjecAgent: Benchmarking Indirect Prompt Injections in Tool-Integrated Large Language Model Agents
InjecAgent는 도구 통합 대형 언어 모델 에이전트의 간접 프롬프트 주입 취약성을 평가하는 벤치마크로, GPT-4 기반 ReAct 프롬프트 에이전트가 24%의 공격 성공률을 보임.
- #295Alaya-EVOKE: From Linear-Scaling Supervision to Endless World
Evoke는 지속적 세계 상태를 외부 기하 메모리에 분리하고, 선형 확장의 지도를 통해 3단계 생성자로 장기적 상호작용을 가능하게 하는 세계 모델이다.
- #298SkillZip: Contract-Preserving Graph Compression for Scalable Agent Skill Libraries
SkillZip은 실행 계약을 보존하면서 실행 그래프를 압축하는 스케일러블 에이전트 스킬 라이브러리 시스템이다.
- #305OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution
OpenART는 복잡하고 진화하는 환경에서 에이전트 안전성을 평가하기 위한 대규모 레드팀 테스트 플랫폼으로, 환경 진화를 통해 85.0%의 공격 성공률을 달성한다.
- #306Self-Evolving Embodied Agents via Skill-Harness Evolution
SHAPER는 모델 파라미터를 고정한 채, 재사용 가능한 스킬과 컨텍스트-코드 헤이버스를 진화시켜 자율적으로 적응하는 임베디드 에이전트를 구현하는 프레임워크이다.
- #307PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives
PlayWorld는 장기적 목표 기반의 대체적 에이전트 플레이어를 통해 비디오 월드 모델을 평가하는 벤치마크를 제시한다.
- #308Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence
SMA는 학습 없이 공간 경험을 재사용 가능한 교훈으로 전환하여 동결된 VLM의 공간 추론을 향상시키는 런타임 프레임워크이다.
- #309AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses
강력한 모델이 추론 시점에서 약한 모델의 성능을 0.49에서 0.91로 향상시키는 추론 환경 설계 방법을 제안한다.
- #310Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning
CaRL을 통해 LLM이 무의미한 추론을 중단하고 능력 경계에 맞춘 행동을 학습한다.
- #311AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models
AtlasVLA는 단일 워리스트 카메라로 장기적 작업을 수행하는 데 있어 지속적 세계-자기 상태를 모델링하여 기존 VLA 모델의 한계를 극복한 새로운 프레임워크이다.
- #312LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers
LLMRouter는 다양한 LLM 라우팅 정책을 개발·평가·배포하는 통합 인프라로, 16개 이상의 라우터와 xRouteBench 벤치마크를 제공하며 14.6%의 상대 성능 향상을 보인다.
- #313Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence
Mechanist는 AI 모델의 작동 메커니즘을 자동으로 탐색하는 시스템으로, 13,000개 논문 기반 지식그래프와 32개 메커니즘 해석 방법을 활용한다.
- #314Learning How the World Evolves: Extrapolative Video World Models via Latent Dynamics Reasoning
LDR은 구조화된 잠재 공간에서 운동적 통합을 통해 동적을 학습하고, 기존 비전 확산 모델보다 훨씬 빠르고 정확하게 외삽하는 비디오 월드 모델이다.
- #315Structure-preserving uncertainty quantification for GENERIC dynamics
S-PENNs는 물리 구조를 유지하면서 불확실성을 양자화하는 새로운 UQ 프레임워크로, GENERIC 역학에서 계산 비용을 1~3자리 줄이며 열역학적 일관성을 보장한다.
- #316DarwinX: Evolving Agent Harnesses Through Natural Selection
DarwinX는 모델 가중치를 고정한 상태에서 헤이버스를 진화시켜 LLM 에이전트의 일반적 역량을 향상시키는 자연선택 기반 프레임워크이다.
- #317Poor Man's Agentic Modeling: Simulating Large LLM-Agent Societies on a Laptop
LLM 에이전트 사회 시뮬레이션을 저비용으로 대체할 수 있는 방법을 제안하며, 경제 시뮬레이션 EconAgent 등 8개 시스템에서 정량적으로 검증한다.
- #318Intern-S2-Preview: Scientific Agentic Foundation Model
Intern-S2-Preview-397B는 과학적 추론, 도구 상호작용, 장기적 작업을 지원하는 다중 모달 과학 에이전트 기반 모델이다.
- #319How Can Rhetoric Reward-Hack AI Reviewers? Dissecting Rhetorical Sensitivity in AI-Based Peer Review
AI 리뷰어의 판단이 과학적 내용을 유지하면서도 수사적 표현에 따라 달라질 수 있음을 밝힌 연구.
- #320AVA-Encoder: Towards Agent-Native Video Representation Learning
AVA-Encoder는 영화 콘텐츠를 에이전트가 이해하고 편집할 수 있는 구조화된 지식 그래프로 변환하여, 에이전트 네이티브 비디오 표현 학습을 구현한다.