- #1O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning
O-VAD는 도메인 지식 없이 객체 중심 추적과 추론을 통해 산업 영상 이상 탐지를 수행하는 트레이닝-프리 에이전트 프레임워크이다.
- #2Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning
Molt는 PyTorch 기반의 가벼운 강화학습 학습 프레임워크로, 연구자와 AI 코드 어시스턴트가 알고리즘 흐름을 직관적으로 추적하고 수정할 수 있도록 설계되었다.
- #3Scaling Native Multimodal Pre-Training From Scratch
시작부터 멀티모달 데이터로 학습하는 네이티브 멀티모달 사전 학습의 확장 법칙을 실증적으로 규명하여, 모델 크기와 토큰 수의 최적 배분을 제시한다.
- #7Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills
Skill Self-Play(Skill-SP)는 LLM의 능력을 코진화하는 프레임워크로, 제안자, 해결자, 동적 기술 컨트롤러를 활용한다.
- #9Spectral Prior for Reducing Exposure Bias in Diffusion Models
Spectral Alignment (SPA)는 확산 모델의 주파수 의존적 노이즈 오류를 보정해 이미지 생성 품질을 향상시키는 가이던스 기반 방법이다.
- #13SCALE: Self-Supervised Constraint-Aware Layout GEneration for Local P&R DRV Fixing at Advanced Nodes
SCALE은 sub-2nm 노드에서 자동 P&R DRV 수정을 위한 자기감독적 레이아웃 생성과 도메인 적응 VLM 기반의 프레임워크이다.
- #14Closing the Loop: Training-Free Revisit Consistency for Autoregressive Generative Rendering
3D 엔진에서 제공하는 대응 정보를 활용해 훈련 없이 자동 생성 렌더링의 재방문 일관성을 향상시킨다.
- #18DataPrep-Bench: Benchmarking LLMs as Training Data Preparators
DataPrep-Bench는 LLM 기반 학습 데이터 준비의 두 핵심 능력(데이터 생성 및 품질 평가)을 통합 평가하는 첫 번째 벤치마크이다.
- #29Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems
AI 에이전트의 실패 원인을 메모리 관리 문제에서 컨텍스트 라이프사이클 관리 문제로 재정의하고, 이를 구현한 ACM 프레임워크와 Maximem Synap 시스템을 제시한다.
- #32Three-Body Scattering for Generative Modeling
TBSM은 에너지 거리 기반 삼체 산란을 활용해 ImageNet-256에서 FID 1.63을 달성한 일괄 생성 모델이다.
- #34Spectral Flow Certificates for Depth-Aware Long-Range Propagation in Graph Neural Networks
Spectral Flow Certificate(SFC)는 GNN의 깊이와 그래프 구조만으로 훈련 전에 장거리 성능을 90% 이상 예측할 수 있는 단일 스칼라 지표를 제안한다.
- #35Neural Feature Governance: Extending Atom Prevalence
NAP는 구조적 스파스성과 해석성을 동시에 달성하는 베이지안 신경망 프레임워크로, MNIST에서 8%의 노드만 사용하면서도 93.4%의 예측 구간 커버리지를 보인다.
- #36Diffusion Models in Medical Image Inpainting: Challenges, Solution Taxonomy, and Future Directions
의료 이미지 인페인팅에서 확산 모델의 활용, 주요 아키텍처, 데이터셋, 평가 방법을 60개 연구를 바탕으로 체계적으로 분석하고, 주요 과제와 미래 방향을 제시한다.
- #37LAMAR: An Open Language-Aware Multilingual Alignment Reranker
LAMAR은 다국어 문서 재정렬 시 언어 일관성을 고려하는 언어 인식 다국어 크로스 인코더로, 언어 일관성 평가에서 nDCG@1 1위 성과를 달성했다.
- #40ICAE-Bench: Evaluating Coding Agents as Interactive Project Builders
ICAE-Bench는 퍼지 요구사항 기반 프로젝트 생성 능력을 평가하는 새로운 벤치마크이다.
- #41Multi-Head Latent Control: A Unified Interface for LLM Agent Decision Making
Multi-Head Latent Control은 기존 LLM을 수정하지 않고도 추론 시점의 제어 결정을 개선하는 경량 레이어를 제안한다.
- #42Train the Model, Not the Reader: Decodability Supervision for Verifiable Activation Explanations
RECAP은 활성화 설명의 신뢰성을 향상시키기 위해 타겟 모델 자체를 학습하는 새로운 접근법을 제시한다.
- #43Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning
Trace는 다영역 시각 추론을 위한 세분화된 프로그램 중심 환경으로, 24개 외부 벤치마크에서 Qwen2.5-VL-3B와 7B 모델의 성능을 각각 3.51%와 4.06% 개선한다.
- #44IDEAgent: Agentic Quality-Diversity Search for Research Idea Generation
IDEAgent는 과학적 아이디어 생성을 Quality-Diversity(QD) 탐색으로 모델링한 다중 에이전트 프레임워크로, 32개 주제에서 Yield 지표 기준 3.89배 성능 향상을 보인다.
- #45SceneActBench: Can Agents Act on the 3D Scenes They See?
SceneActBench는 3D 환경에서 시각 정보를 바탕으로 대리자가 행동하는 능력을 평가하는 새로운 벤치마크이다.
- #46GraphVid: Interactive Graph-Controllable Video Generation
GraphVid는 구조화된 상호작용 그래프를 기반으로 정밀한 멀티오브젝트 제어를 가능하게 하는 이미지-비디오 생성 모델이다.
- #47Differentiable Logic Gate Networks for Low-Latency EEG Classification on Edge Devices
Diff-Logic은 부동소수점 연산 대신 비트 연산을 기반으로 한 EEG 분류 성능과 지연 시간을 동시에 개선하는 신경망 구조를 제안한다.
- #48VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression
VisCo는 사전 학습된 VLM을 활용한 시각 토큰 압축 프레임워크로, 훈련 비용 없이 높은 압축률에서도 성능을 유지한다.
- #49Dataset Distillation by Influence Matching
Inf-Match는 최종 모델 파라미터에 미치는 영향을 일치시키는 방식으로 데이터셋 디스틸레이션을 수행하여 기존 방법 대비 정확도를 향상시킨다.
- #50ENTRAP-VL: A Taxonomic Probe for Dual Contextual Entrainment in Vision-Language Models
ENTRAP-VL은 시각-언어 모델에서 문맥에 의한 출력 편향을 체계적으로 평가하기 위한 이중 모달성 탐사 도구이다.