- #1Toward Generalist Anomaly Detection via In-Context Residual Learning with Few-Shot Sample Prompts
InCTRL은 few-shot 정상 이미지를 기반으로 잔차를 학습하여 다양한 도메인의 이상 탐지를 일반화하는 새로운 GAD 모델이다.
- #2AHA: A Vision-Language-Model for Detecting and Reasoning Over Failures in Robotic Manipulation
AHA는 시각-언어 모델을 활용해 로봇 조작 실패를 탐지하고 추론하는 시스템으로, 실패 데이터셋 AHA와 FailGen을 통해 21.4% 성공률 향상.
- #4ReNoise: Real Image Inversion Through Iterative Noising
ReNoise는 반복적인 노이징을 통해 확산 모델의 역추적 정확도를 향상시키는 이미지 역추적 기법이다.
- #8Lotus: Diffusion-based Visual Foundation Model for High-quality Dense Prediction
Lotus는 기존 디퓨전 모델의 단점을 개선한 고정밀 밀집 예측 기반 시각 기초 모델로, 단계 수를 줄이고 노이즈 예측 대신 직접 어노테이션 예측을 통해 성능과 효율성을 동시에 향상시킨다.
- #9WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning
WebAgent-R1은 다중 턴 웹 에이전트 학습을 위한 엔드투엔드 강화학습 프레임워크로, WebArena-Lite 벤치마크에서 Llama-3.1-8B의 성공률을 44.8%까지 끌어올렸다.
- #10Context Length Alone Hurts LLM Performance Despite Perfect Retrieval
긴 입력 길이 자체가 LLM의 성능을 저하시키며, 이는 단순한 검색 실패와 무관하다.
- #11RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text Detectors
RAID는 기계 생성 텍스트 탐지기의 강건성을 평가하기 위한 최대 규모의 벤치마크 데이터셋이다.
- #12How do Large Language Models Handle Multilingualism?
LLMs는 다국어 처리를 영어로 변환-이해-생성하는 3단계 워크플로우(MWork)를 통해 수행하며, PLND를 통해 검증하고 언어별 정밀 조정이 가능하다.
- #13On the Effects of Data Scale on UI Control Agents
UI 컨트롤 에이전트의 성능이 데이터 규모에 어떻게 영향을 받는지 AndroidControl 데이터셋을 통해 분석한 연구.
- #14OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding
OMG-LLaVA는 단일 모델로 이미지, 객체, 픽셀 수준의 추론과 이해를 통합한 MLLM으로, 1개의 LLM, 1개의 인코더, 1개의 디코더로 다양한 비주얼-텍스트 작업을 수행한다.
- #310REMORY: Learning Residual Memory for Context Compaction
- #315Evaluating the Transfer of Co-Evolved Communication from 2D to 3D Simulation
2D 시뮬레이터에서 진화한 로봇 간의 공동 통신 메커니즘이 3D 물리 시뮬레이터로 전이되었을 때의 성능 변화를 분석한다.
- #317Embodied Turing Machines: Stateful Code for Robot Recursive Self-Improvement
COAP는 로봇 정책을 코드로만 구현하여 재귀적 자기 개선(RSI)을 가능하게 하는 새로운 패러다임이다.
- #318Pumpire: Unified Benchmark for Metric Distance Estimation
Pumpire는 3D 기초 모델의 점-점 거리 추정 능력을 직접 평가하는 통합 벤치마크로, 6,400개의 실제 장면 데이터와 29개 기준 모델 실험을 통해 정확도를 분석한다.
- #321Opera: A Verbal Critic Framework for Long-horizon Coding Agents
Opera는 장기적 코드 생성 작업에서 지속적인 피드백을 관리하는 언어 기반 크리틱 프레임워크로, 테스트 시 15.0%까지 해결률을 향상시킨다.
- #322Do LLMs Understand Sequential Structure? A Controlled Study of Inference and Generation
LLMs가 표면 행동 통계 이상의 순차 구조를 이해하는지 실험적으로 검증한 연구.
- #323ReSPO: Reshaped Sequence Policy Optimization for Gradient Starvation in Off-Policy Learning
ReSPO는 off-policy 학습에서 발생하는 gradient starvation 문제를 해결하기 위해 α-divergence 기반의 sequence-level kernel을 도입한 새로운 정책 최적화 방법이다.
- #324Mara Chain: Rethinking Failure as a Stepping Stone for AI System Auto-Evolution
Mara Chain은 거부된 후보를 반복적으로 개선함으로써 AI 시스템 최적화 성능을 20.5%까지 향상시키는 새로운 절차를 제시한다.
- #325MIRA: A Musical Intent Refinement Agent for Aligning Text-to-Music Generation with User Intent
MIRA는 사용자 의도와 음악 생성을 정렬하기 위해 MuRA-Bench 기반의 검증 가능한 루비릭 항목을 사용하는 테스트 시점 에이전트다.
- #326Can AI Agents Make Open-Ended Scientific Discovery? Evidence from Station
Station은 Supervisor와 Meta Reflection을 통해 62.7%의 과학적 발견을 자율적으로 재현하는 다중 에이전트 연구 환경이다.
- #327A Closer Look at Agentic BBO: Benchmarking LLM Agents for Black-Box Optimization
AgenticBBO-Bench를 통해 LLM 에이전트의 BBO 성능을 다분야 비교하고, 핵심 성능 요인을 분석한 연구.
- #328SpaceFlow: Locally Controllable 3D Generation
SpaceFlow는 3D 생성 시 지역적 제어를 가능하게 하는 훈련 없이 사용할 수 있는 프레임워크로, 지역별 기하학적 제약과 외관 조건을 독립적으로 적용한다.
- #329Accurate but Not Humble: Evaluating Epistemic Humility in LLM Agents under Knowledge Conflict
LLM 에이전트가 지식 충돌 상황에서 겸손하게 불확실성을 인식하고 전달하는 능력을 평가하는 새로운 프레임워크를 제안한다.
- #330Distilling Routed 3D Privilege for Spatial Reasoning in Vision-Language Models
GPD는 3D 정보를 질문에 조건화된 방식으로 활용해 시공간 추론 능력을 향상시키는 RGB-only VLM 학습 프레임워크이다.
- #332SpecFold: Folding Multi-Branch Redundancy for Faster Speculative Decoding in Diffusion Language Models
SpecFold는 다중 분기 추측 디코딩에서 계산 중복성을 활용해 디퓨전 언어 모델의 처리 속도를 최대 1.99배 향상시키는 알고리즘-시스템 협력 설계이다.
- #333Incremental Open-Ended Deep Research with Structured Harness
Incremental-OEDR은 기존 연구 보고서를 기반으로 새로운 정보를 반영해 효율적으로 업데이트하는 시스템으로, DeepResearch Bench에서 ROUGE-L F1 0.51, EM F1 0.63 개선을 기록했다.
- #334One Block, Multiple Depths: Recurrent Vision Transformers with Depth-Programmed Experts
reViT은 단일 Transformer 블록을 반복 적용하여 ViT의 전체 깊이 성능을 유지하면서 파라미터 수를 73% 줄인다.
- #335CARE: Certifying Acceleration for Vision-Language-Action Inference
CARE는 VLA 모델 가속화 시 발생할 수 있는 실패를 인증하면서 최대 10.8× 가속을 보장하는 정량적 접근법이다.
- #336BrickBench: Evaluating Agentic Brick Design
BrickBench는 텍스트 조건에 기반한 에이전트 기반 레고 세트 설계를 평가하는 벤치마크로, 설계의 유효성, 정렬, 디자인 품질을 측정한다.
- #337Incidental information contaminates patient notes and disrupts clinical reasoning in large language models
대규모 언어 모델(LLM)이 임상 기록과 추론 과정에서 부수적 정보에 민감하게 반응하여 의료 오류를 유발할 수 있음을 밝힘.