- #12SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment
SUFLECA는 674K 이미지로 학습한 기하학적 특징을 기반으로 CAD 모델과 RGB 이미지를 정렬하는 제로샷 방법이다.
- #23RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination
RxBrain은 언어-시각적 추론과 상상력을 결합한 임바디드 인지 기초 모델이다.
- #24Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations
On-policy distillation(OPD)의 역할, 병리, 규제를 체계적으로 분석하고, 신뢰성 있는 신호로 학습 안정성을 향상시킨다.
- #26Video = World + Event Stream
Wan-Streamer v0.3은 영상 생성을 "세계 + 이벤트 스트림"으로 분해하여 실시간 다중모달 상호작용을 구현한 모델이다.
- #28Discrete Diffusion Models: A Unified Framework from Tokenization to Generation
이 연구는 토큰화를 중심으로 하는 이산 확장 모델의 통합적 프레임워크를 제시한다.
- #29Tracing Agentic Failure from the Flow of Success
OAT는 성공 트래젝토리만으로 학습하여 실패 트래젝토리의 오류 단계를 탐지하는 무감독 실패 분석 모델로, GPT-5 대비 200–5000배 빠르고 F1 점수 +20% 개선.
- #30DeepLoop: Depth Scaling for Looped Transformers
DeepLoop는 반복된 파라미터 재사용을 고려한 잔차 스케일링 규칙을 제안하여 Looped Transformer의 안정적 깊이 확장을 가능하게 한다.
- #31WanSong v1.0 Technical Report
WanSong v1.0은 5분 길이의 다국어 고품질 음악을 단일 스테이지 확산 모델로 생성하며, 보컬과 배경음악을 분리 출력하는 음악 생성 기반 모델이다.
- #32MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators
MeanFlowNFT는 MeanFlow 생성 모델에 최초로 적용된 forward-process RL 프레임워크로, 평균 속도 기반 샘플링 효율성을 유지하면서 생성 품질을 향상시킨다.
- #33PalmClaw: A Native On-Device Agent Framework for Mobile Phones
PalmClaw는 모바일 기기에서 직접 실행되는 오픈소스 에이전트 프레임워크로, 11.5%의 작업 성공률 향상과 94.9%의 완료 시간 감소를 기록했다.
- #34Vinci2: Providing Proactive Assistance in Continuous Egocentric Videos
Vinci2는 지속적인 1인칭 비디오에서 사용자의 히스토리와 현재 활동을 고려해 적절한 시점에 개입하는 프로액티브 보조 시스템으로, EgoMemo와 EgoServe를 제시한다.
- #35Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel
12B 규모의 언어 모델에 검증된 지식을 바이트 단위로 이식하여 정확도를 80.0%에서 93.3%로 높이고, 추론 비용을 6,574배 절감하는 기술을 제시한다.
- #36From Noisy Traces to Root Causes: Structural Trajectory Analysis and Causal Extraction for Agent Optimization
STRACE는 실행 추적의 잡음을 줄이고 근본 원인을 추출하여 에이전트 최적화 성능을 1.4배 향상시키는 구조적 분석 프레임워크이다.
- #37VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance
VIABench는 시각 장애인의 일상 지원을 위한 MLLM 평가를 위한 첫 번째 1인칭 영상 벤치마크로, Proactive Reminder, VQA, Vision-Guided Interaction 3가지 핵심 작업을 정의하고 있다.
- #38Length Penalties Make Chain-of-Thought Less Monitorable
길이 제재가 사고 과정을 줄이면서 모델의 답변 영향을 감추는 경향이 있다.
- #39Self in Space: Benchmarking Self-Awareness and Spatial Cognition in UAV Embodied Intelligence
SIS-Bench는 UAV 시나리오에서 공간 인지와 자기 인식을 평가하는 새로운 벤치마크로, MLLM의 자기 인식 부족과 인지 계층별 성능 저하를 밝혀내며, motion-aware 표현이 이를 개선함을 보인다.
- #40Token Time Continuous Diffusion for Language Modeling
TTCD는 토큰별 시간 개념을 도입한 연속 확산 언어 모델로, 빠른 속도에서도 생성 성능을 유지한다.
- #41AsySplat: Efficient Asymmetric 3D Gaussian Splatting for Long-Sequence Scene Modeling
AsySplat은 3D Gaussian Splatting에서 계산 중복을 줄이기 위해 기하학과 외관 모델링을 분리한 비대칭 구조를 제안하여, 800× 가속과 30% 파라미터 감소를 달성한다.
- #42Partition, Prompt, Aggregate: Statistical Self-Consistency in Language Models
LLM이 통계적 자기일관성을 얼마나 잘 따르는지 평가하는 연구.
- #43Rethinking the Evaluation of Harness Evolution for Agents
LLM 에이전트의 하버스 진화 평가 프로토콜을 재검토하고, 기존 평가 방식의 한계를 드러냄.
- #44Generative Compilation: On-the-Fly Compiler Feedback as AI Generates Code
Rust 언어에서 생성 중인 코드에 실시간 컴파일러 피드백을 제공하는 새로운 방법, Generative Compilation을 제안한다.
- #45GRASP: GRanularity-Aware Search Policy for Agentic RAG
GRASP는 강화학습 기반의 다단계 추론을 위한 적응형 검색 정책으로, 의미 검색, 키워드 검색, 단락 읽기 동작을 조율한다.
- #46From Controlled to the Wild: Evaluation of Pentesting Agents for the Real-World
[AI 보안 / 펜테스팅 평가] AI 펜테스팅 에이전트를 실제 환경의 "검증된 취약점 발견" 기준으로 평가하는 실용적 평가 프로토콜과 EthiBench를 제안합니다.
- #47Chat2Scenic: An Iterative RAG-Based Framework for Scenario Generation in Autonomous Driving
Chat2Scenic은 자율주행 시스템 시나리오 생성을 위한 반복적 RAG 기반 프레임워크로, 76.42%의 컴파일 성공률을 달성했다.
- #48AffectFlow-DINO: Uncertainty-Aware Multi-Task Affect Estimation via Conditional Rectified Flow
AffectFlow-DINO는 조건부 정류 흐름(conditional rectified flow)을 활용해 얼굴 행동의 불확실성을 모델링하는 다중 태스크 감정 추정 시스템이다.