- #2Behavior Generation with Latent Actions
VQ-BeT는 행동 생성에서 다중 모드를 효과적으로 포착하고 추론 속도를 5배 향상시키는 행동 생성 모델이다.
- #3Perception Encoder: The best visual embeddings are not at the output of the network
Perception Encoder는 단일 대비 학습만으로 이미지와 영상 인식, Q&A, 객체 탐지 등 다양한 작업에서 최고 성능을 달성한 시각 인코더이다.
- #4Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models
Visual Sketchpad는 시각적 사고 체인을 통해 멀티모달 언어 모델의 추론 능력을 향상시키는 프레임워크이다.
- #5MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark
MMAU는 10,000개의 음성-질의-답변 쌍을 포함한, 음성 이해 및 추론 능력을 평가하는 새로운 벤치마크로, 최신 모델들이 53% 미만의 정확도를 기록하며 기술적 한계를 드러낸다.
- #6Time-MoE: Billion-Scale Time Series Foundation Models with Mixture of Experts
Time-MoE는 2.4억 파라미터 규모의 MoE 기반 디코더-온리 트랜스포머로, 3000억 이상의 Time-300B 데이터셋에서 사전 학습하여 시간 시리즈 예측 성능을 대폭 향상시킨다.
- #7OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation
OpenVid-1M은 100만 개 이상의 고품질 텍스트-비디오 쌍을 포함한 대규모 데이터셋으로, MVDiT라는 새로운 다중 모달 디퓨전 트랜스포머를 제안하여 텍스트-비디오 생성을 개선한다.
- #8Improving Alignment and Robustness with Circuit Breakers
"Representation Rerouting" 기반의 Circuit Breakers가 LLM과 멀티모달 모델의 해로운 출력을 억제하면서도 성능 저하 없이 공격에 강한 안정성을 제공한다.
- #9Evolution of Heuristics: Towards Efficient Automatic Algorithm Design Using Large Language Model
EoH는 LLM과 EC를 결합해 휴리스틱을 자동 생성하며, 휴리스틱 아이디어와 코드를 진화시켜 효율적인 알고리즘 설계를 가능하게 한다.
- #10Learning to (Learn at Test Time): RNNs with Expressive Hidden States
TTT 레이어는 테스트 시점에 학습하는 RNN 구조로, 긴 문맥에서 성능을 유지하면서도 선형 복잡도를 달성한다.
- #11MACE: Mass Concept Erasure in Diffusion Models
MACE는 100개 이상의 개념을 확장적으로 제거하면서 일반성과 특이성을 균형 있게 유지하는 텍스트-이미지 디퓨전 모델 개념 제거 프레임워크이다.
- #187Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization
Zero-WAM은 인-컨텍스트 학습을 기반으로 인간 동영상에서 무작위 작업을 추론해 수행하는 로봇 정책을 제시한다.
- #286PAWBench: How Far Are We from Probabilistically Aligned World Modeling?
PAWBench는 영상 생성 모델이 확률적으로 정렬된 세계 모델링에 얼마나 가까운지를 평가하는 벤치마크로, 50개 시나리오에서 기존 11개 시스템이 모두 일관된 분포를 재현하지 못함을 밝힘.
- #305Procedura: Agentic 3D Modeling with Procedural Control
Procedura는 텍스트 프롬프트를 기반으로 3D 모델을 프로시저적 어셈블리 형태로 생성하는 에이전트 프레임워크로, 정밀한 기하 구조와 편집 가능한 파트 분해를 실현한다.
- #307Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling World Models
게임 개발을 기반으로 한 RLHEV 학습 패러다임이 세계 모델 확장에 효과적인 검증 가능한 데이터 엔진으로 제시된다.
- #310UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City
UrbanGround는 홍콩의 실제 3D 지리 데이터를 기반으로 MLLM 에이전트의 도시 내 지속적 탐색 능력을 평가하는 첫 번째 샌드박스 환경이다.
- #311TTPO: Test-Time Policy Optimization
TTPO는 라벨 없이도 수학적 추론 성능을 향상시키는 테스트 타임 정책 최적화 방법으로, Qwen3-1.7B 모델에서 38.0%에서 45.2%로 정확도를 높인다.
- #312Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher
Self-OPD는 교사 모델 없이 흐름 일치 모델에 온-폴리시 디스틸레이션을 적용한 새로운 프레임워크로, K개의 SDE 후보 분기와 정규화된 이점을 기반으로 속도장 최적화를 수행한다.
- #313What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents
LLM 에이전트의 생성 데이터를 ACE(정확도-복잡도-다양성) 관점에서 분석하고, (E,q,τ,v) 요소로 분해하여 생성 프레임워크를 제시한다.
- #314MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization
MA-VLA는 다팔 협업을 위한 구조화된 원-모델 VLA 프레임워크로, Arm Shuffle를 통해 새로운 협업 패턴으로의 일반화를 달성한다.
- #315FU-Mamba: A Frequency-Enhanced Dynamic Scanning Framework for Oralscan Image Segmentation
FU-Mamba는 동적 스캐닝과 주파수 영역 강화를 결합한 구강 이미지 세그멘테이션 프레임워크로, mIoU 1.1% 개선을 달성했다.
- #316Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report
HAT은 실시간 라이브 스트리밍에 적합한 컴팩트 모델을 Harness 변화에 적응하도록 훈련하는 방법으로, 라이브 QA 정확도 94.8, P50 3.4초 달성.
- #317GameWAM: A World Action Model for Video Games
GameWAM은 비디오 게임에서 시각적 미래와 실행 가능한 키보드-마우스 동작을 병렬 생성하는 최초의 World-Action Model이다.
- #318TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback
TacForcing는 실행 중 터치 피드백을 활용한 스트리밍 액션 생성 프레임워크로, 실시간 접촉 상태 변화에 대응한다.
- #319PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents
PILOT은 실시간 자기 개선을 통해 장기적 작업 성능을 향상시키는 감독자-작업자 구조의 에이전트 허네스이다.
- #320Is Next-Chunk Reasoning RL Really Better than SFT? Revisiting Training Strategies under no-CoT Data
Mixed SFT는 next-chunk reasoning RL보다 훨씬 저렴하면서도 높은 post-RLVR 성능을 달성한다.
- #321Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds
JoyAI-Echo-1.5는 장기적 영상 생성과 인터랙티브 월드 모델링을 위한 통합 오디오-비주얼 생성 시스템으로, 메모리, 기하학적 제어, 롤아웃 기반 학습을 결합하여 일관성과 제어력을 향상시킨다.
- #322Open-MOPD: Diagnosing and Fixing Capability Imbalance in Multi-Teacher On-Policy Distillation
Open-MOPD는 다중 전문가 정책 증류에서 발생하는 능력 불균형을 진단하고 해결하는 프레임워크로, 토큰 수준 최적화 예산의 부적절한 할당 문제를 해결하여 성능 회복률을 35.6%에서 83.4%로 향상시킨다.
- #323Video-IFBench: Evaluating Instruction Following of Multimodal LLMs in Video Understanding Scenarios
Video-IFBench는 영상 이해 시 사용자 지시사항을 충족하는 다중모달 대형 언어 모델(MLLM)의 능력을 평가하는 새로운 벤치마크이다.
- #324Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO
진화 전략(Evolution Strategies, ES)이 GRPO보다 더 넓은 추론 커버리지를 제공하며, Pass@K 성능을 향상시킨다.
- #325V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning
V-Rubrics는 시각적 근거성을 세부 항목 기반 강화 학습으로 향상시키는 VLM 후학습 프레임워크이다.