- #1Scaling Large-Language-Model-based Multi-Agent Collaboration
MacNet을 통해 1,000개 이상의 대형 언어 모델 기반 에이전트가 협력하는 구조와 성능을 분석하고, 협력적 스케일링 법칙을 제시한다.
- #2FoundationStereo: Zero-Shot Stereo Matching
FoundationStereo는 제로샷 제너럴라이제이션을 달성한 대규모 스테레오 깊이 추정 기초 모델로, 1M쌍의 합성 데이터와 Side-Tuning Adapter, AHCF 모듈을 통해 실내외 데이터셋에서 뛰어난 성능을 보인다.
- #4Feature Interaction Modeling for Physics-Informed Neural Networks and Neural Operators
- #5Structured 3D Latents for Scalable and Versatile 3D Generation
SLat 기반 3D 생성 모델 Trellis는 500K 개의 3D 자산으로 학습되어 높은 품질의 3D 생성과 편집을 지원한다.
- #6MambaIR: A Simple Baseline for Image Restoration with State-Space Model
MambaIR은 이미지 복원에서 Mamba 기반 모델의 국부적 퍼픽스 유사성과 채널 상호작용을 강화하여 기존 CNN 및 Transformer 대비 뛰어난 성능을 보인다.
- #7SnapKV: LLM Knows What You are Looking for Before Generation
SnapKV는 KV 캐시 압축을 통해 LLM의 메모리 효율과 생성 속도를 향상시키는 fine-tuning-free 방법이다.
- #8Simple and Effective Masked Diffusion Language Models
마스킹된 디퓨전 언어 모델(MDLM)이 기존 AR 모델과 유사한 성능을 보인다.
- #9Show-o: One Single Transformer to Unify Multimodal Understanding and Generation
Show-o는 단일 트랜스포머로 멀티모달 이해와 생성을 통합한 모델로, 자동회귀와 확산 모델링을 결합하여 다양한 비전-언어 작업을 처리한다.
- #10TimeMixer: Decomposable Multiscale Mixing for Time Series Forecasting
TimeMixer는 다중 스케일 분해와 혼합을 통해 시계열 예측 성능을 향상시키는 MLP 기반 모델이다.
- #11OLMo: Accelerating the Science of Language Models
OLMo는 훈련 데이터와 코드를 포함한 완전한 오픈 소스 언어 모델로, LLaMA-7B 대비 유사한 성능을 보인다.
- #12MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?
MathVerse는 MLLMs가 수학 문제의 다중 모달 정보를 얼마나 정확히 해석하는지를 평가하기 위한 새로운 수학 시각적 벤치마크이다.
- #125N_0-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation
- #176QQWorld: Quantile-Quantile Matching for World Model Regularization
- #306Mental World Modeling
- #307N_0-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens
- #309From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement
- #313ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow
ODEWorld는 물리 시간 기반 ODE 속도장을 학습하는 PT-Flow를 기반으로 한 연속형 세계 모델로, 장기 예측과 정밀한 이미지 재구성을 가능하게 한다.
- #314Meshy T2: Fast Native Mesh Generation with Flow Matching
- #317AISPA: User-Centric System Prompt Auditing for Large Language Model Applications
- #318EMBL AI Librarian: Life-Sciences Knowledge Layer for AI Agents
- #320Scaling Properties of Text Conditioning in Visual Generation
- #322SAF-OPD: Stable Advantage Fusion for On-Policy Distillation
SAF-OPD는 RLVR과 OPD의 결합 시 발생하는 신호 불균형 문제를 해결해 정확도를 0.51–2.70% 개선한다.
- #323β-OPSD: Deriving with Policy Optimization, Training with Self-Distillation
β-OPSD는 정책 최적화 기반의 자가 교사 학습(SEL)을 효율적으로 근사하는 새로운 자가 교사 학습 알고리즘으로, 수학적 추론 성능을 향상시킨다.
- #324Fewer Clarifications, Better Code: Benchmarking Cross-Session Personalized Ambiguity Adaptation in Coding Assistants
- #326Can Large Language Models Execute Parent Orders?
LLM 기반 PACE 프레임워크가 주문 실행 비용을 0.65 bps 개선하며 인간 투자자와 다른 행동 패턴을 보인다.
- #327Enhancing Rubric-based RL via Self-Distillation
- #328ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction
- #329INTACT: Isomorphic Intent-to-Action Learning for Search-Free World Models
INTACT는 액션-라벨이 있는 트레이젝토리로부터 검색 없이 목표에 도달하는 인텐트-액션 매핑을 학습하는 엔드투엔드 JEPA 모델이다.
- #330Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation
Explorative Modeling(XM)은 생성 모델의 학습 루프를 탐색하여 모드를 명확히 포착하고, 기존 생성 모델의 성능과 end-to-end 생성을 동시에 향상시킨다.
- #331Evaluation-Verification Reward for Consistent Multi-Reference Image Editing