- #1DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation
DreamX-Phi 1.0은 언어 지시와 로봇 동작을 조건으로 미래 장면을 예측하는 조건부 영상 월드 모델로, WorldArena 2.0에서 Track 1 1위, Track 2 2위를 달성했다.
- #2UMA: A Family of Universal Models for Atoms
UMA는 5억 개 이상의 3D 원자 구조를 학습한 대규모 원자 모델로, Mixture of Linear Experts(MoLE) 아키텍처를 통해 정확도와 속도를 동시에 달성한다.
- #3Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?
현재 RLVR은 기존 LLM의 추론 능력을 확장하지 못하며, 기반 모델의 범위 내에서만 작동한다.
- #4Large Language Diffusion Models
LLaDA는 확률적 추론을 위한 확산 모델 기반 대규모 언어 모델로, 기존 자동회귀 모델과 유사한 성능을 보인다.
- #5H2R-Bench: Benchmarking Human-to-Robot Manipulation Video Generation in World Models
H2R-Bench는 인간 조작 영상을 로봇 중심 조작 영상으로 전환하는 능력을 평가하는 벤치마크로, 6개 조작 유형과 2개 로봇 구조에서 11개 모델을 평가한다.
- #6Flow-GRPO: Training Flow Matching Models via Online RL
Flow-GRPO는 온라인 강화학습을 플로우 매칭 모델에 통합한 최초의 방법으로, GenEval 정확도를 63%에서 95%까지 향상시킨다.
- #7Search-o1: Agentic Search-Enhanced Large Reasoning Models
Search-o1은 OpenAI-o1과 같은 대규모 추론 모델의 지식 부족 문제를 해결하기 위해 에이전트 기반 검색 및 문서 내 추론 모듈을 결합한 프레임워크이다.
- #8MM-LLMs: Recent Advances in MultiModal Large Language Models
지난 1년간 MM-LLMs가 비용 효율적인 훈련 전략을 통해 다양한 멀티모달 작업을 지원하며 발전하고 있다.
- #9Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation
Janus는 시각 인코딩을 분리하여 멀티모달 이해와 생성을 통합하는 자동회귀 프레임워크이다.
- #10LongMemEval: Benchmarking Chat Assistants on Long-Term Interactive Memory
LongMemEval은 대화형 챗봇의 장기 기억 능력을 평가하는 벤치마크로, 500개의 질문과 세 가지 단계의 메모리 설계 최적화를 제시한다.
- #11LoRA+: Efficient Low Rank Adaptation of Large Models
LoRA+는 LoRA의 효율성을 개선한 저랭크 튜닝 알고리즘으로, A와 B 행렬에 서로 다른 학습률을 적용하여 성능과 학습 속도를 향상시킨다.
- #12The Lessons of Developing Process Reward Models in Mathematical Reasoning
수학적 추론에서 과정 오류를 감지하는 Process Reward Model(PRMs)의 개발 과정에서 MC 추정법의 한계와 BoN 평가 전략의 편향을 분석하고, 이를 개선한 새로운 합의 필터링 메커니즘을 제안한다.
- #227Alaya-EVOKE: From Linear-Scaling Supervision to Endless World
Evoke는 지속적 세계 상태를 외부 기하 메모리에 분리하고, 선형 확장의 지도를 통해 3단계 생성자로 장기적 상호작용을 가능하게 하는 세계 모델이다.
- #306Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning
CaRL을 통해 LLM이 무의미한 추론을 중단하고 능력 경계에 맞춘 행동을 학습한다.
- #307PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives
PlayWorld는 장기적 목표 기반의 대체적 에이전트 플레이어를 통해 비디오 월드 모델을 평가하는 벤치마크를 제시한다.
- #308Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence
SMA는 학습 없이 공간 경험을 재사용 가능한 교훈으로 전환하여 동결된 VLM의 공간 추론을 향상시키는 런타임 프레임워크이다.
- #309LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers
LLMRouter는 다양한 LLM 라우팅 정책을 개발·평가·배포하는 통합 인프라로, 16개 이상의 라우터와 xRouteBench 벤치마크를 제공하며 14.6%의 상대 성능 향상을 보인다.
- #312DarwinX: Evolving Agent Harnesses Through Natural Selection
DarwinX는 모델 가중치를 고정한 상태에서 헤이버스를 진화시켜 LLM 에이전트의 일반적 역량을 향상시키는 자연선택 기반 프레임워크이다.
- #313Learning How the World Evolves: Extrapolative Video World Models via Latent Dynamics Reasoning
LDR은 구조화된 잠재 공간에서 운동적 통합을 통해 동적을 학습하고, 기존 비전 확산 모델보다 훨씬 빠르고 정확하게 외삽하는 비디오 월드 모델이다.
- #314Intern-S2-Preview: Scientific Agentic Foundation Model
Intern-S2-Preview-397B는 과학적 추론, 도구 상호작용, 장기적 작업을 지원하는 다중 모달 과학 에이전트 기반 모델이다.
- #315How Can Rhetoric Reward-Hack AI Reviewers? Dissecting Rhetorical Sensitivity in AI-Based Peer Review
AI 리뷰어의 판단이 과학적 내용을 유지하면서도 수사적 표현에 따라 달라질 수 있음을 밝힌 연구.
- #316AVA-Encoder: Towards Agent-Native Video Representation Learning
AVA-Encoder는 영화 콘텐츠를 에이전트가 이해하고 편집할 수 있는 구조화된 지식 그래프로 변환하여, 에이전트 네이티브 비디오 표현 학습을 구현한다.
- #317AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design
AutoDesign은 학술 논문을 포스터로 자동 생성하는 과정에서 인간 선호에 맞춘 재귀적 개선을 통해 78.32 점을 달성한 메타-해버 시스템 최적화 프레임워크이다.
- #319Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus
혼합형 선형 어텐션 대형 언어 모델(HLA LLM)에서 대규모 활성화(MA)의 두 가지 형태, pre-attention spikes(PAS)와 inter-spike plateaus(ISP)를 체계적으로 분석하고, 이들의 발생 메커니즘과 학습 과정에서의 변화를 밝혔다.
- #320From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs
저주파 수음 불가 신호가 대규모 오디오-언어 모델(LALM)의 안정성에 심각한 위협을 가하며, 이를 평가하고 완화하기 위한 ILL과 DRG 방법이 제안된다.
- #321Self-Geometry: GT-Free and Plug-and-Play Test-Time Adaptation for Geometrically Consistent 3D Vision Foundation Models
Self-Geometry는 테스트 시에 2D 픽셀 대응 관계를 활용해 기하학적 일관성을 강제하는 플러그 앤 플레이형 3D 비전 모델 적응 파이프라인이다.
- #322UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos
UniSwap은 말하는 영상에서 시각적 외형과 음성을 실시간으로 통합 교체하는 첫 번째 스트리밍 프레임워크이다.
- #323LiveAnimate: Stable Long-Form Streaming Human Animation in Real-Time
LiveAnimate는 14B 파라미터 DiT 기반으로 실시간 스트리밍과 장시간 안정적 생성을 결합한 첫 번째 인간 애니메이션 시스템이다.
- #325TailBooster: A Dual-Layer Generative Framework for Extreme Value Augmentation with Operational Validity Enforcement
TailBooster는 극단적 항공 운항 데이터를 생성하면서 운영 적합성을 보장하는 이중 계층 생성 프레임워크이다.
- #327Full-bandwidth transformer
Full-bandwidth transformer는 토큰 단위 피드백 대신 전체 히든 상태를 재사용해 추론 성능을 향상시키며, 1.5배 더 많은 토큰으로 학습한 모델과 유사한 결과를 낸다.