- #1NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction
NCP-ArchPreview는 개념 수준 예측을 도입한 대규모 잠재공간 언어 모델로, 기존 토큰 예측 기반 모델보다 높은 성능을 보인다.
- #2AutoWebGLM: A Large Language Model-based Web Navigating Agent
AutoWebGLM은 HTML 단순화 알고리즘과 강화학습을 결합한 웹 탐색 에이전트로, GPT-4를 능가하며 AutoWebBench에서 뛰어난 성능을 보인다.
- #3Sundial: A Family of Highly Capable Time Series Foundation Models
Sundial은 TimeFlow Loss를 도입한 확장성 높은 시계열 생성 모델로, 1조 개의 시계열 포인트로 사전 학습되어 최신 성능을 달성한다.
- #4Scaling Automatic Research Agents via World Models
WMRL은 AutoResearch 에이전트의 RL 학습을 3–4× 가속화하면서 성능을 향상시키는 세계 모델 기반 접근법이다.
- #5GenAD: Generative End-to-End Autonomous Driving
GenAD는 생성 모델링 기반의 end-to-end 자율주행 프레임워크로, nuScenes 벤치마크에서 최고 성능을 달성한다.
- #6Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction
Aguvis는 화면 이미지 기반의 통합 GUI 에이전트로, Qwen2-VL과 2D-RoPE를 활용해 플랫폼 간 호환성과 추론 능력을 향상시킨다.
- #7Scaling Diffusion Language Models via Adaptation from Autoregressive Models
GPT2와 LLaMA를 기반으로 확장된 DiffuGPT와 DiffuLLaMA는 200B 토큰 미만으로 훈련되어 기존 DLM을 능가하고 AR 모델과 경쟁한다.
- #8Diffusion-TS: Interpretable Diffusion for General Time Series Generation
Diffusion-TS는 시계열 생성의 해석성과 현실성을 동시에 달성하는 디퓨전 모델 기반 프레임워크이다.
- #9Automated Design of Agentic Systems
Meta Agent Search를 통해 코드 공간에서 자동으로 설계된 에이전트 시스템이 기존 수작업 에이전트를 크게 초과함.
- #10AppWorld: A Controllable World of Apps and People for Benchmarking Interactive Coding Agents
AppWorld는 일상 디지털 작업 자동화를 위한 대규모 API 기반 인터랙티브 코딩 에이전트 벤치마크 및 실행 환경을 제공한다.
- #11Show-o2: Improved Native Unified Multimodal Models
Show-o2는 3D 인과 VAE와 자동회귀 모델링, 플로우 매칭을 결합한 네이티브 통합 멀티모달 모델로, 이미지와 동영상 처리에서 우수한 성능을 보인다.
- #12BrushNet: A Plug-and-Play Image Inpainting Model with Decomposed Dual-Branch Diffusion
BrushNet은 기존 디퓨전 모델에 플러그 앤 플레이 방식으로 결합 가능한 듀얼-브랜치 디퓨전 모델로, 이미지 인페인팅 성능을 7개 메트릭에서 개선한다.
- #302SpatialBlock: Enhancing Spatial Intelligence in LVLMs via Synthetic Block-Stacking Problem
SpatialBlock-15k라는 합성 블록 쌓기 데이터셋을 통해 LVLM의 공간 지능을 향상시키는 새로운 학습 패러다임을 제안한다.
- #304Mi-Ripple: Restoring Images Degraded by Iterative AI Editing
Mi-Ripple은 반복적인 AI 이미지 편집으로 생긴 디지털 릴리프를 진단 기반으로 복원하는 워크플로우다.
- #305SenseNova-U1.5: Towards Native Unified Visual Intelligence
SenseNova-U1.5는 8B-MoT 아키텍처를 기반으로, 인코더 및 VAE 없이 시각 이해, 추론, 생성을 통합한 4K 해상도까지 지원하는 네이티브 통합 시각 지능 모델이다.
- #306AgentGrad: Intervention-guided Prompt Optimization for Multi Agent Systems
AgentGrad는 순차적 개입과 의미론적 텍스트 그라디언트 추상화를 통해 다중 에이전트 시스템의 프롬프트 최적화 성능을 2.5배 빠르게 개선하는 프레임워크다.
- #307SyncWorld: Visual Calibration Enables World Models as Zero-Shot Simulators
SyncWorld는 시각 교정을 통해 학습된 액션-시각 매핑을 기반으로, 추가 학습 없이 새로운 환경에서 제로샷 시뮬레이션을 수행하는 월드 모델이다.
- #308Memory as Plans: World-Action Modeling with Memory-Grounded Planning
MaP-WAM은 장기 기억 기반 계획과 실행을 분리하여 RMBench에서 83.3% 성공률을 달성한 로봇 제어 프레임워크이다.
- #309Valerant: An Automatic Navigable Game Map Generator via Action-Conditioned World Model Exploration
Valerant는 3D 게임 맵을 자동 생성하는 훈련 없이 작동하는 프레임워크로, 예측된 시각 정보와 SLAM 기반 재구성을 결합한다.
- #310From State Synchronization to Cognitive Self-Evolution: An Operational Architecture for Cognitive Digital Twins
4단계 CDT 아키텍처를 제안하여 인지 기능을 체계적으로 통합하고, 운영 효율성을 향상시킨다.
- #311Seven Sources of Physical AI Capability Formation
물리적 AI의 능력 형성 원인을 7가지 독립적 출처로 분류하고 이론적 포화를 달성한 연구.
- #312Processing and classifying bird songs using wavelet techniques and supervised learning
고음질 환경 소음 속 조류 소리 분류를 위해 베이지안 웨이블릿 기법과 SVM 분류기 결합한 통합 프레임워크를 제안한다.
- #313Train Smarter, Not Harder: Switching Signal-Guided Training in Active Learning
HybridAL은 모델 경로의 안정화를 감지하여 재학습과 미세조정을 적응적으로 전환하는 활성 학습 전략으로, 49%의 시간 절약과 NLL 기반 교정 개선을 달성한다.
- #314T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks
T1은 122B Mixture-of-Experts 모델로, 300+ 툴 호출을 처리하며 강화 학습을 통해 터미널 작업 성능을 64.0%까지 향상시킨다.
- #315EvoSafeHarness: Evolving Model- and Domain-Specific Harnesses for Securing Agents
EvoSafeHarness는 모델과 도메인에 맞춘 안전성 햬스를 진화적으로 생성하여, 기존 정적 햬스 대비 안전성-유틸리티 균형을 개선한다.
- #316WearableQA: A Benchmark for Health Reasoning over Real-World Wearable Data
WearableQA는 200명의 실제 사용자 데이터를 기반으로 건강 추론 능력을 평가하는 4,084개의 다중 선택형 질문을 포함한 새로운 벤치마크이다.
- #317RESCUE-BENCH: Towards Relation-Aware Multi-Party Emotional Support Conversation Systems
RESCUE-Bench는 대규모 언어 모델이 다자간 감정 지원 대화에서 관계를 이해하고 활용하는 능력을 평가하는 새로운 벤치마크이다.
- #318SWE-Bench Pro Verified: A Reliable Benchmark for Software Engineering Agents
SWE-Bench Pro Verified는 기존 SWE-Bench Pro의 신뢰도 문제를 해결한 소프트웨어 엔지니어링 에이전트 평가 벤치마크이다.
- #319PARSER: Read in Parallel, Reason in Depth for Long-Context LLM Agents
PARSER는 긴 문서를 병렬로 읽고 추론을 반복적으로 수행하여, 기존 순차 메모리 기반 모델 대비 정확도와 추론 속도를 동시에 개선한 LLM 에이전트 구조이다.
- #320SAEScientist-Bench: Can AI Agents Conduct Autonomous SAE Interpretability Research?
AI 에이전트가 SAE 도구를 활용해 자율적으로 모델 해석 연구를 수행할 수 있는지 평가하는 벤치마크인 SAEScientist-Bench를 제안한다.