- #1How Far is Video Generation from World Model: A Physical Law Perspective
비디오 생성 모델이 물리 법칙을 학습하는 능력은 확장만으로는 한계가 있으며, 특정 조건에서 색상>크기>속도>형태 순으로 데이터 속성에 의존하는 경향이 있다.
- #2Large Discovery Models: Empirically-grounded Model-Based Open-Ended Search
LDM은 생성 모델과 베이지안 비모수 보상 서로게 모델을 결합한, 개방적 가설 공간에서의 효율적 탐색 엔진이다.
- #3AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders
AxBench 벤치마크를 통해 LLM 조정 방법 비교 실험에서 ReFT-r1이 SAE보다 우수한 성능을 보임.
- #4EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
EmbodiedBench는 시각 기반 에미바디드 에이전트의 종합적 평가를 위한 벤치마크로, 1,128개의 다양한 태스크와 6개의 능력 중심 서브셋을 포함한다.
- #5R1-Onevision: Advancing Generalized Multimodal Reasoning Through Cross-Modal Formalization
R1-Onevision은 시각-언어 정보를 정확히 결합하는 새로운 cross-modal 추론 파이프라인과 데이터셋, 평가 벤치마크를 제시하여 멀티모달 추론 성능을 획기적으로 향상시킨다.
- #6Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models
"스파스 피처 서킷"을 통해 언어 모델 내 인터프리터블한 인과 그래프를 자동으로 발견하고 편집하는 방법을 제시한다.
- #7Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts
ArmoRM과 MoE를 결합한 해석 가능한 보상 모델이 RewardBench에서 최상의 성능을 보인다.
- #8LVBench: An Extreme Long Video Understanding Benchmark
LVBench는 4시간 이상 긴 영상 이해 능력을 평가하는 새로운 벤치마크로, 기존 모델의 한계를 드러내며 연구 촉진을 목표로 한다.
- #9Long-CLIP: Unlocking the Long-Text Capability of CLIP
Long-CLIP은 CLIP의 텍스트 길이 제한을 풀어 248 토큰까지 처리하며, 기존 성능을 유지하거나 개선하는 플러그 앤 플레이 방식의 확장 모델이다.
- #10OmniGen: Unified Image Generation
OmniGen은 단일 모델로 텍스트-이미지 생성, 이미지 편집, 조건 기반 생성 등 다양한 이미지 생성 작업을 처리하는 통합 확산 모델이다.
- #11The Platonic Representation Hypothesis
AI 모델의 표현이 시간과 도메인, 데이터 모달리티를 넘어 점점 더 일치하며 "플라톤적 표현"으로 수렴하고 있다는 가설을 제시한다.
- #205HarnessEval-W: Agentifying the Evaluation of Visual Worlds
HarnessEval-W는 세계 모델 평가를 위한 에이전트 기반 파이프라인으로, 330개 평가 사례에서 인간 선호와 높은 일치도를 보인다.
- #303UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations
UI-Mate는 환경 기반 학습과 인-컨텍스트 데모 학습을 결합한 오픈-웨이트 GUI 에이전트로, OSWorkerBench에서 41.0%의 엄격한 성공률을 달성했다.
- #304Self-Supervised Visual On-Policy Distillation
S²VOPD는 강화된 학습 신호를 생성하기 위해 학습자의 입력에 정보를 제거하는 방식으로, 특권 정보 없이도 정교한 시각 인식 성능을 향상시킨다.
- #305VideoGAIA: A Benchmark for General AI Assistants on Agentic Video Understanding
VideoGAIA는 MLLM의 다단계, 도구 활용형 비디오 이해 능력을 평가하는 새로운 벤치마크로, 기존 90% 정확도에 가까운 단일 질문 대답 평가를 넘어서는 새로운 패러다임을 제시한다.
- #306Agentic Transaction: Towards ACID-Compliant Agent Systems
LLM 에이전트 시스템에 ACID 트랜잭션 개념을 도입하여 신뢰성과 일관성을 향상시킨다.
- #307Early Cycle Charge Trajectory Generative Prediction and Full Life Cycle Health Management of Iron-Chromium Flow Batteries Based on FlowBD-E1
FlowBD-E1은 철-크롬 흐름전지의 초기 사이클 데이터만으로 전체 충전 전압/전류 궤적을 0.731% 이하의 오차로 예측하는 생성 모델이다.
- #308VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?
VibeWorlding은 사용자 질의로부터 3D 오픈 월드를 생성하는 멀티모달 에이전트를 평가하고 훈련하는 통합 프레임워크로, VWE-Bench와 VibeWorlding-Gym을 통해 3D 월드 생성의 정확성과 한계를 분석한다.
- #309Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization
SA-MRPO는 다중 보상 최적화에서 포화 상태에 따라 보상 가중치를 동적으로 재조정하여 학습 효율을 향상시킨다.
- #310MOSS-VL Technical Report
MOSS-VL은 실시간 영상-언어 상호작용을 핵심 기능으로 설계된 오픈 소스 모델로, 11.3B 파라미터와 게이티드 크로스-어텐션을 통해 OmniMMI Proactive Alerting에서 66.0 점을 달성했다.
- #311ClawGym II: Exploring Black-Box RL on Agent Harness
ClawGym II는 복잡한 블랙박스 헤이브스를 통해 일반 에이전트를 안정적이고 확장 가능한 방식으로 최적화하는 통합 RL 프레임워크를 제시한다.
- #312Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence
Apodex Discovery는 실제 문제 해결을 위한 AI 평가 프레임워크로, AAV 캡시드 설계에서 기존 최고 성능을 7% 초과 달성.
- #313DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data
Mimir v1은 허가된 데이터만을 사용해 10억 파라미터 HRM 모델로, 영어 및 덴마크어 벤치마크에서 뛰어난 성능을 보인다.
- #314An Empirical Study of Training Pixel-Space Text-to-Image Diffusion Models
픽셀 공간 확산 모델의 대규모 훈련 전략을 실증적으로 분석하고, 래티언트-픽셀 전이 레시피를 제안하여 3.18~4.75배의 추론 가속을 달성했다.
- #315Advancing Open and Reproducible Relational Learning: RelArena-α, TabPFN-Rel and RPI
Prior Labs는 RelArena-α, TabPFN-Rel, RPI를 오픈소스로 발표하며 관계 학습 연구의 재현성과 비교성을 강화한다.
- #316How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks
AI 연구 에이전트의 실패 원인을 진단하기 위한 100개 과제와 45개 실패 패턴을 제시하는 AutoResearchEval과 ARFT를 소개한다.
- #317GenRouter: Unified Workflow Routing for Agentic Image Generation
GenRouter는 다양한 이미지 생성 워크플로우를 통합하고 효율적으로 라우팅하여 비용과 지연을 95%와 65% 줄이는 첫 번째 통합 프레임워크이다.
- #318DumpsterCluster: From Dumpster Diving to Serving LLaMA-70B on $60 GPUs
128개의 중고 V100 GPU로 구성된 DumpsterCluster를 통해 LLaMA-70B 추론을 $22K에 구현하며, 에너지 및 탄소 조건에 따라 경제적·환경적 이점을 분석.
- #319Amplified Does Not Mean Predictive: Reasoning Behaviors in Thinking Models
15개 모델을 대상으로 15,282개 추론 트레이스를 분석하여, 사고 훈련이 정확도와 강하게 연관된 행동을 증폭시키지 않는다는 사실을 밝힘.
- #320Prior Audit-Repair Context Shifts LLM Verifier Thresholds Toward Leniency
LLM 체커가 이전에 동일한 작업을 수정한 경우, 오류 신고율이 2.8~11.5%포인트 감소한다.