- #1RealNet: A Feature Selection Network with Realistic Synthetic Anomaly for Anomaly Detection
RealNet은 SDAS, AFS, RRS를 결합한 새로운 이상 탐지 프레임워크로, MVTec-AD 등 4개 데이터셋에서 기존 최고 성능을 개선한다.
- #2PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs
PIVOT는 VLM을 사용한 시각적 반복 프롬프팅을 통해 로봇 제어 및 공간 추론을 제로샷으로 수행하는 새로운 접근법이다.
- #3Timer: Generative Pre-trained Transformers Are Large Time Series Models
Timer는 대규모 사전학습을 통해 생성적 타임시리즈 모델로, 다양한 분석 작업을 통합 처리한다.
- #4Autoregressive Image Generation without Vector Quantization
이미지 생성에서 벡터 쿼언티제이션 없이 확산 손실을 기반으로 오토회귀 모델을 적용한 새로운 접근법을 제안한다.
- #5SiT: Exploring Flow and Diffusion-based Generative Models with Scalable Interpolant Transformers
SiT는 DiT 기반으로 설계된 생성 모델로, 다양한 디퓨전 계수와 연속 시간 학습을 통해 ImageNet에서 FID-50K 2.06을 달성한다.
- #6Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces
MLLMs가 비디오 기반 공간 인지 능력을 갖는지 탐구한 연구로, VSI-Bench라는 새로운 벤치마크를 제시하고 공간 추론 능력 향상을 위한 인지 지도 생성 방법을 제시.
- #7How Johnny Can Persuade LLMs to Jailbreak Them: Rethinking Persuasion to Challenge AI Safety by Humanizing LLMs
일상적 설득 기법을 활용한 LLM 해킹(Persuasive Jailbreak)이 기존 알고리즘 기반 공격을 크게 초과하며, AI 안전성 연구의 새로운 관점을 제시한다.
- #8Self-Rewarding Language Models
자체적으로 보상을 생성하는 Self-Rewarding Language Models를 제안하여 LLM의 지속적 성능 향상을 실현한다.
- #9Evaluating Very Long-Term Conversational Memory of LLM Agents
LLM 에이전트의 매우 장기적 대화 기억 능력을 평가하기 위해 LoCoMo 데이터셋과 3가지 평가 태스크를 제시하며, LLM의 장기 기억 처리 능력이 여전히 인간 수준에 크게 못 미친다는 것을 밝힘.
- #10SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training
SFT는 데이터를 암기하지만, RL은 GeneralPoints와 V-IRL에서 33.8% 성능 향상과 함께 일반화 능력을 높인다.
- #296DiffusionGemma Technical Report
DiffusionGemma는 고속 텍스트 생성을 위한 이산 확산 기반 언어 모델로, 기존 오토회귀 모델 대비 1,500 토큰/초의 속도를 달성한다.
- #298Mental World Modeling
MWM은 물리적 상태뿐 아니라 정신 상태까지 통합한 세계 모델링 프레임워크로, 인간 행동 예측 정확도를 향상시킨다.
- #303LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation
LeapTalk은 단일 단계로 200 FPS의 실시간 토킹헤드 생성을 가능하게 하며, 지나치게 많은 단계를 요구하는 확산 모델과 오류 누적 문제를 해결한다.
- #304WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning
WCM은 VLA-RL에서 관찰 역사와 환경 역학을 동시에 학습하는 World Critic Model로, 149개 태스크에서 SOTA 성능을 달성했다.
- #305LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks
LongHorizon-Harness는 MEA 루프를 통해 장기적 작업의 신뢰성을 향상시키는 새로운 에이전트 프레임워크이다.
- #306SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks
SwanTale은 자연어와 제로샷 기반의 다발성 음성 및 오디오 생성을 지원하는 통합 모델로, SwanData-Caption 데이터셋과 SwanVAE, Unified MoE 등 다양한 기술을 결합하여 뛰어난 표현력을 달성했다.
- #307DreamTraj: Generating 6-DoF Object Trajectories by Reading Unrendered Video Diffusion Latents
DreamTraj는 단일 RGB 이미지와 작업 지시문으로 6-DoF 물체 궤적을 생성하는 새로운 접근법으로, 비디오 생성 없이 확산 모델 내부 표현에서 직접 추출한다.
- #308Weak-to-Strong On-Policy Distillation
W2S-OPD는 강한 학습자 모델을 여러 약한 모델로부터 학습시켜 성능을 향상시키는 새로운 온-포리시 디스틸레이션 프레임워크이다.
- #309DAPD: Dual-Anchored Policy Distillation
DAPD는 정보 비대칭 문제를 해결해 on-policy distillation에서의 privilege illusion을 완화하고, Qwen3-4B에서 평균 +2.00점 개선을 달성한 새로운 정책 증류 프레임워크이다.
- #310Progressive Agent Skill Generation via Reinforcement Learning
Skill-α는 강화학습을 활용해 문서 및 경험에서 고질적인 에이전트 스킬을 점진적으로 생성하는 방법이다.
- #311EMBL AI Librarian: Life-Sciences Knowledge Layer for AI Agents
EMBL AI Librarian는 자연어 질의를 기반으로 생물학적 문헌 증거를 추출하는 AI 에이전트용 지식 레이어를 제시한다.
- #312VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation
VAD는 시각적 증거 기반의 교정 성분을 추정하고 재구성하여 멀티모달 온-폴리시 디스틸레이션의 성능을 향상시킨다.
- #313WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity
WorldExam은 1,474개의 테스트 케이스로 구성된 비디오 월드 모델 평가 벤치마크로, 시각적 품질을 넘어 내재적 반응성을 평가한다.
- #314CADENA: Stepwise CAD Reverse Engineering
CADENA는 3D 메시지를 단계별로 파라메트릭 CAD 프로그램으로 재구성하는 모델로, 기존 방법 대비 정확도를 향상시킨다.
- #315UEmbed: Unified Sparse and Dense Multimodal Embeddings
UEmbed는 단일 모델로 텍스트 및 다중 모달의 밀집형과 희소형 임베딩을 동시에 생성하는 디코더 전용 모델이다.
- #316SAF-OPD: Stable Advantage Fusion for On-Policy Distillation
SAF-OPD는 RLVR과 OPD의 결합 시 발생하는 신호 불균형 문제를 해결해 정확도를 0.51–2.70% 개선한다.
- #317In the Driver's Seat: A Multi-Company Study on the Reality of Autonomous Driving System Testing
9개 회사 전문가 인터뷰를 통해 자율주행 시스템 테스트의 현황과 문제점을 분석하고, 폐루프 테스트 프레임워크를 제안한 연구.
- #318Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs
자율주행 VLM에서 미래 경로를 지연 노출하여 검증 가능한 추론을 구현하는 DEFT-RLVR과 AD-MCQ를 제안한다.
- #319SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation
SKT는 2,000개 공개 스킬을 기반으로 27,164개 검증된 실행 경로를 생성하여 LLM의 스킬 활용 능력을 향상시키는 데이터 합성 파이프라인이다.
- #320Fewer Clarifications, Better Code: Benchmarking Cross-Session Personalized Ambiguity Adaptation in Coding Assistants
CAPA 벤치마크를 통해 사용자별 반복적 모호성을 최소 클리어런스로 해결하는 코드 어시스턴트의 성능을 평가한다.