- #1Real-IAD: A Real-World Multi-View Dataset for Benchmarking Versatile Industrial Anomaly Detection
Real-IAD는 150K 장의 고해상도 이미지를 포함한 실세계 다각도 산업 이상 탐지 대규모 데이터셋이다.
- #2WarpSAC: Towards the Pinnacle of Scalable Off-policy RL by Rethinking Exploration and Exploitation
WarpSAC는 데이터 규모에 따라 안정화 기법을 조정함으로써, 확장 가능한 오프-정책 강화학습의 성능을 4.5%~23.1% 개선하는 알고리즘 패밀리이다.
- #3When Does Frequency Decomposition Benefit Physics-Informed Neural Networks? A Preliminary Ablation Study
주파수 분해가 PINN 성능에 언제 도움이 되는지 탐구한 실험적 연구.
- #4Physics-Informed Error Field Learning: A Post-Training Optimization Framework for Physics-Informed Neural Networks
PIEFL은 PINN의 후기 최적화 단계에서 오차 필드를 학습함으로써 계산 효율성을 향상시키는 새로운 프레임워크이다.
- #5Lowering the Barrier to AI-Driven Inspection: A No-Code Workflow for Automated Structural Defect Detection
YOLOEZ는 프로그래밍 없이 YOLO 기반 구조물 결함 탐지 모델을 개발할 수 있는 GUI 기반 오픈소스 플랫폼이다.
- #6AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents
AgentHarm은 LLM 에이전트의 해로운 행동을 측정하기 위한 벤치마크로, 110개의 악의적 에이전트 작업과 440개의 증강 작업을 포함한다.
- #7Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach
잠재 공간에서 반복적 추론을 통해 테스트 타임 계산을 확장하는 새로운 언어 모델 아키텍처를 제안한다.
- #8LLMLingua-2: Data Distillation for Efficient and Faithful Task-Agnostic Prompt Compression
LLMLingua-2는 Transformer 기반의 데이터 디스틸레이션을 통해 2~5배 압축된 프롬프트를 생성하며, 기존 방법 대비 1.6~2.9배 빠른 처리 속도를 보인다.
- #9PointMamba: A Simple State Space Model for Point Cloud Analysis
PointMamba는 3D 포인트 클라우드 분석에 Mamba 기반의 선형 복잡도 상태공간 모델을 도입한 간단하고 효율적인 접근법이다.
- #10Spotting LLMs With Binoculars: Zero-Shot Detection of Machine-Generated Text
Binoculars는 두 개의 사전 학습된 LLM을 사용하여 제로샷 방식으로 90% 이상의 정확도로 기계 생성 텍스트를 탐지하는 새로운 방법이다.
- #11ToolRL: Reward is All Tool Learning Needs
ToolRL은 강화학습 기반의 보상 설계를 통해 LLM의 도구 사용 능력을 17% 향상시키는 체계적인 연구이다.
- #12CRUXEval: A Benchmark for Code Reasoning, Understanding and Execution
CRUXEval은 코드 추론, 이해, 실행 능력을 평가하는 800개의 간단한 파이썬 함수로 구성된 새로운 벤치마크이다.
- #13Parallelizing Linear Transformers with the Delta Rule over Sequence Length
DeltaNet의 학습을 시퀀스 길이에 대해 병렬화한 하드웨어 효율 알고리즘을 제안하고, 1.3B 파라미터 모델로 실험하여 Mamba와 GLA를 상회하는 성능을 보인다.
- #14Gen3C: 3D-Informed World-Consistent Video Generation with Precise Camera Control
Gen3C는 3D 캐시를 기반으로 정밀 카메라 제어와 시간적 3D 일관성을 달성하는 비디오 생성 모델이다.
- #99D$^3$-MOPD: Adaptive Dynamic Domain ScheDuling for Efficient Multi-Teacher Distillation
D$^3$-MOPD는 학습 속도에 따라 도메인 혼합을 동적으로 조정해 MOPD의 효율성을 3× 향상시키는 제로오버헤드 스케줄러이다.
- #233GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture
GigaBrain-0.7는 37,000시간 이상의 이질적 로봇 데이터로 사전 학습한 3시스템 아키텍처 기반의 VLA 모델로, 다양한 로봇 형태에서의 제로샷 성능과 작업 성공률을 대폭 향상시킨다.
- #291Code World Model: Coding Agent as World Brain
Code World Model은 코드 기반 월드 브레인과 비디오 모델을 결합하여 지속적이고 시각적으로 풍부한 세계 진화를 구현하는 프레임워크이다.
- #304Game2World Engine: Unlocking In-the-Wild Gameplay Videos for World Model Training
게임 플레이 영상에서 UI를 제거해 월드 모델 학습 데이터를 생성하는 Game2World 엔진과 GameCleaner 모델을 제안한다.
- #305Multi-Modal Anomaly Detection: A Survey
다중 모달 이상 탐지(MMAD)를 가정 기반 관점에서 체계적으로 정리하고, 기존 연구의 한계와 미래 방향을 제시한다.
- #310SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation
SecOPD는 토큰 수준 피드백을 통해 적응형 프롬프트 주입 공격에 대응하는 방식으로 Qwen3.6-27B 모델의 공격 성공률을 94.0%에서 9.0%로 낮춘다.
- #311VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction
VoiceMem은 실시간 음성 대화 시스템에 정보와 감정 메모리를 결합한 스트리밍 듀얼 브레인 메모리 프레임워크이다.
- #312VGI-BENCH: Probing Visual Intelligence in Video Generation Models
VGI-Bench는 영상 생성 모델의 시각적 추론 능력을 평가하기 위한 새로운 벤치마크로, Seedance 2.0 모델이 51.0% 성능을 기록하는 등 현재 모델들의 한계를 드러낸다.
- #313FrontierChallenge: Evaluating Scientific Workflow Completion
FrontierChallenge는 과학적 워크플로우 완료 능력을 평가하는 다분야 벤치마크로, 97개 과제에서 최고 성능 모델의 Pass Rate가 20.6%에 불과한 것으로 나타났다.
- #314Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs
OraRL은 비디오 MLLM의 강화학습 후처리를 효율화하고 확장 가능한 새로운 프레임워크로, 어노테이션을 직접 오라클로 활용하여 성능을 66.0~78.2%까지 향상시킨다.
- #315StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models
StreamPI는 기존 단일 프레임 VLA 모델에 시간 정보를 추가하면서 추가 파라미터 없이 실시간 추론을 가능하게 하는 스트리밍 멀티모달 시간 모델링 프레임워크이다.
- #316AgentRoom: Concurrent Multi-Agent Coding in a CRDT-Backed Shared Workspace
AgentRoom은 CRDT 기반 공유 워크스페이스에서 동시 다중 에이전트가 협업하는 실시간 프로토콜로, 파일 수준 클레임과 브로드캐스트를 통해 협업 실패를 억제한다.
- #317WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report
WeMM-Embedding은 2B, 4B, 9B 규모의 다중 모달 임베딩 모델로, MMEB-v2에서 80.6 점을 달성하며 실무 성능도 입증했다.
- #318JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution
JIT-Agent는 임의의 LLM에 실시간으로 최적화된 agent harness를 생성하여 성능을 대폭 향상시킨다.
- #319Automata from Agent Traces: Failure and Next-Step Prediction
LLM 에이전트의 실행 트레이스를 기반으로 생성된 FSM이 다음 단계 예측과 실패 예측 성능을 동시에 향상시킨다.
- #320VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning
VBVR-Pro는 시각 생성을 기반으로 한 네이티브 시각 추론을 학습 가능하고 검증 가능하게 구현한 종합적인 테스트베드이다.