- #1AC3D: Analyzing and Improving 3D Camera Control in Video Diffusion Transformers
AC3D는 3D 카메라 제어를 개선한 비디오 디퓨전 트랜스포머로, 정밀한 카메라 조작과 시각 품질을 동시에 달성한다.
- #5Paying More Attention to Image: A Training-Free Method for Alleviating Hallucination in LVLMs
PAI는 훈련 없이 이미지 토큰의 어텐션 가중치를 증폭하고 텍스트 로짓을 감소시켜 LVLM의 환각을 줄이는 인퍼런스 인터벤션 방법이다.
- #6Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition
Video-of-Thought(VoT)는 MotionEpic이라는 새로운 비디오 MLLM과 CoT 기반 추론 프레임워크를 결합하여 복잡한 비디오 QA 성능을 획기적으로 향상시킨다.
- #7Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for LLM Problem-Solving
LLM 추론 성능을 최적화하기 위해 추론 전략과 모델 크기의 관계를 실증적으로 분석한 연구.
- #8LLaMA-Omni: Seamless Speech Interaction with Large Language Models
LLaMA-Omni는 Llama-3.1-8B-Instruct 기반으로 구축된, 음성 입력을 직접 텍스트 및 음성 출력으로 생성하는 저지연 음성-LLM 상호작용 모델이다.
- #9WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling
WavTokenizer는 24kHz 음성을 초당 40~75개의 토큰으로 압축하면서 뛰어난 재구성 품질과 의미 정보를 유지하는 디스크리트 오디오 코덱 모델이다.
- #10MoBA: Mixture of Block Attention for Long-Context LLMs
MoBA는 MoE 원리를 기반으로 한 Block Attention 메커니즘으로, LLM의 긴 문맥 처리 효율성을 향상시킨다.
- #11Rethinking the Bounds of LLM Reasoning: Are Multi-Agent Discussions the Key?
단일 에이전트가 강력한 프롬프트를 사용하면 다중 에이전트 토론과 유사한 추론 성능을 달성할 수 있음을 실험적으로 밝힘.
- #12Stable Virtual Camera: Generative View Synthesis with Diffusion Models
Stable Virtual Camera (SEVA)는 확산 모델 기반으로 입력 뷰와 타겟 카메라로부터 새로운 뷰를 생성하는 일반적인 뉴럴 뷰 합성 모델이다.
- #13FLARE: Feed-Forward Geometry, Appearance and Camera Estimation from Uncalibrated Sparse Views
FLARE는 2~8장의 비보정 이미지에서 카메라 포즈, 3D 기하, 외관을 0.5초 이내에 추정하는 피드포워드 모델이다.
- #318OmniEcho: Spatial Audio Understanding for Embodied Agents
OmniEcho는 공간 음향 정보를 통합한 다중 모달 모델로, 실제 환경에서의 음향-시각 인식 및 탐색 성능을 향상시킨다.
- #322EmbodiedSWE: Coding Agents for Long Horizon Dexterous Robotics
EmbodiedSWE는 로봇이 복잡한 장기적 작업을 해결하고 이를 정책 학습에 활용하는 프레임워크로, 코드 생성 에이전트와 VLA 학습을 결합한다.
- #323PACT: From Credit Assignment to Critic Alignment
PACT는 신뢰성 있는 크레딧 할당 기반의 정책-비평가 조정을 통해 수학적 추론 및 코드 생성 성능을 72.87%와 67.4%로 향상시킨다.
- #325Capable yet Parsimonious: Extracting and Characterizing Hidden Chain-of-Thought in Frontier Models
GPT-6 Astra는 토큰 효율적이고 직선적인 추론 경로를 통해 높은 성능을 유지하면서도 최소한의 추론 흐름만 외부화한다.
- #326GeoPair: Geometry-Preserving Cross-Layer Factorization for Training-Free Transformer Compression
GeoPair는 훈련 없이 트랜스포머 압축을 수행하는 기하학적 구조를 보존하는 교차 레이어 인수분해 프레임워크이다.
- #327ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds
ExplorationBench는 AI 시스템의 탐색 능력을 측정하기 위한 새로운 벤치마크로, AlienCode와 AlienLogic이라는 2개의 실행 가능한 환경을 통해 새로운 가설을 발견하고 적용하는 능력을 평가한다.
- #328Verifiable Hidden Dynamics Play: Generating Agentic RL Environments from Solved Mechanisms
VHD-Play는 수학 모델 기반 생성 파이프라인을 통해 3,300개의 신뢰 가능한 에이전트 환경을 생성하고, Qwen3.6-35B-A3B 모델의 에이전트 점수를 0.204에서 0.815로 향상시킨다.
- #329Learning to Discover Interesting Mathematics
27B 규모의 모델을 활용해 수학적 정리의 흥미도를 정량화하고, 자율적인 수학적 발견 프레임워크를 제시한다.
- #330Parts-of-Speech as Emergent Categories in SAE Latent Space
LLM의 SAE 잠재 공간에서 형태-문법 정보가 분산된 형태로 나타남을 실증적으로 밝힘.
- #331Coding Agents for Generalized Task and Motion Planning Problems
코딩 에이전트가 일반화된 TAMP 문제 해결에서 기존 기법을 상회하는 성능을 보인다.
- #332IterSynth: Rethinking Deep Search Agents via Role-Decoupled Iterative Synthesis
IterSynth는 역할 분리와 요약 기반 설계를 통해 깊은 검색 성능을 향상시키는 새로운 에이전트 프레임워크이다.
- #333WhatWorkedBench: Benchmarking Experimental Understanding in AI Agents
WhatWorkedBench는 AI 에이전트의 실험적 이해력을 측정하는 벤치마크로, 조건별 구성 요소 효과를 정확히 예측하는 능력을 평가한다.
- #334RGBD20K: A Large-Scale Benchmark for RGB-D Semantic Segmentation
RGBD20K는 160개의 세분화된 카테고리와 20,000개의 RGB-D 이미지 쌍을 포함한 대규모 높은 품질의 RGB-D 세분화 벤치마크 데이터셋이다.
- #335All modalities are equal, but video is more equal: Closing the Cross-Attention Gap in Joint Video Generation
RecCAR은 비디오-모션 및 비디오-오디오 생성에서 상호 모달 일관성을 향상시키는 경량 KL 정규화 기법이다.
- #336AgentKernel: The Trust-Native Agentic Operating System
- #337On the Diffusibility of High-Dimensional Latents
고차원 레퍼런스 오토인코더(Representation Autoencoder, RAE)에서 x₀-예측이 텍스트-이미지 생성 성능을 일관되게 향상시킨다.
- #338Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures
Jev 모델은 RLCD를 통해 단일 호출로 10가지 정렬 실패 탐지를 0.886 AUROC 성능으로 제시한다.
- #339PUBG Ally: A Conversational Embodied Agent as an AI Teammate
PUBG Ally는 실시간 게임 플레이와 음성 대화를 결합한 첫 번째 상용 배틀로얄 게임 내 AI 동료이다.
- #340AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation
AV-GRPO는 AV 생성에서 신뢰성 있는 보상 할당과 동기화를 위해 모달리티-앵커드 디코플링 디퓨전 강화학습을 제안한다.
- #341Self-Organizing Agent Teams Learn to Reason Together
AI 에이전트 팀이 협력적 추론을 학습해 개별 에이전트가 도출하지 못한 정답을 생성하는 Self-Organizing Agent Teams (SAT)를 제안한다.