- #1HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone
HiFi-UMI는 3mm 정밀도의 무로봇 조작 데이터를 생성해, 무로봇 데이터만으로 실제 로봇에 직접 배포 가능한 정책 학습을 실현한다.
- #2VMamba: Visual State Space Model
VMamba는 2D 선택적 스캔과 크로스-스캔 모듈을 결합한 시각 상태 공간 모델로, 높은 성능과 선형 복잡도를 동시에 달성한다.
- #3AlphaFold Meets Flow Matching for Generating Protein Ensembles
AlphaFlow와 ESMFlow는 PDB 및 MD 앙상블 데이터를 기반으로 단백질 구조 다양성을 생성하는 flow matching 기반 생성 모델이다.
- #4DAPO: An Open-Source LLM Reinforcement Learning System at Scale
DAPO는 AIME 2024에서 50점 달성한 Qwen2.5-32B 기반의 대규모 LLM 강화 학습 시스템이다.
- #5CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer
CogVideoX는 16fps, 768×1360 해상도로 10초 길이의 텍스트-비디오를 생성하는 확장형 디퓨전 트랜스포머 모델이다.
- #6Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data
Depth Anything는 62M 개의 자동 라벨링된 비정제 이미지를 기반으로 강력한 제로샷 단일 카메라 깊이 추정 모델을 구축한 연구이다.
- #7YOLOv12: Attention-Centric Real-Time Object Detectors
YOLOv12는 주목 메커니즘 기반의 실시간 객체 탐지 모델로, YOLOv10-N 대비 2.1% mAP 향상과 1.64 ms의 빠른 추론 속도를 달성한다.
- #8Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model
Vision Mamba(Vim)는 양방향 SSM과 위치 임베딩을 결합한 시각적 표현 학습 모델로, DeiT 대비 2.8× 빠르고 86.8% GPU 메모리 절약.
- #9Depth Anything V2
Depth Anything V2는 합성 이미지와 대규모 의사 라벨을 활용해 단일 카메라 깊이 추정 모델의 성능과 효율성을 획기적으로 향상시킨다.
- #10MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark
MMLU-Pro는 기존 MMLU 대비 16~33% 낮은 정확도를 기록하며, 추론 능력을 더 잘 평가하는 다분야 언어이해 벤치마크이다.
- #11KAN: Kolmogorov-Arnold Networks
KAN은 MLP 대신 가중치에 스플라인 함수를 사용해 정확도와 해석성을 동시에 향상시킨 신경망 구조이다.
- #27EvoPINN: Agentic Discovery of Executable Algorithms for Physics-Informed Neural Networks
EvoPINN은 LLM 기반 에이전트를 활용해 PDE 특화 학습 알고리즘을 자동으로 발견하는 실행 기반 프레임워크로, SLRC-PINN 아키텍처를 독자적으로 개발해 기존 방법 대비 L2 오차를 감소시킨다.
- #275TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
TurboVLA는 RTX 4090에서 32Hz, 0.9GB VRAM으로 97.7% 성공률을 달성한 실시간 VLA 모델이다.
- #299Wonder: Video World Model Done Better
Wonder는 16 FPS로 분 단위 동영상 생성이 가능한 실시간 카메라 제어형 비디오 월드 모델이다.
- #305CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition
CLBench-V는 다중 모달 컨텍스트 학습을 평가하기 위한 벤치마크로, 3,443개 인스턴스에서 최고 점수 0.2847를 기록하며 모델의 한계를 드러낸다.
- #306Temporal-Distance JEPA: Plan-Aware Representation Learning for Latent World Model Predictive Control
TD-JEPA는 오프라인 로그에서 시간적 진행 구조를 추출해 JEPA 월드 모델의 제어 성능을 향상시키는 계획 인식 학습 방법이다.
- #307A New Role for Relevance: Guiding Corpus Interaction in Agentic Search
RARG는 문서 레벨의 관련성을 grep 탐색 순서와 매칭 정보 필터링에 활용해 검색 수렴을 가속화하는 에이전트다.
- #308CodeNib: A Multi-View Data System for Serving Repository Context to Coding Agents
CodeNib은 레포지토리 컨텍스트를 다중 뷰로 재사용하고 효율적으로 제공하는 데이터 시스템이다.
- #309StatePlay: State-Aware Game World Models for Mechanics-Consistent Generation
StatePlay는 게임 내부 상태를 예측하여 기계적 일관성을 유지하는 첫 번째 상태 인식 게임 월드 모델이다.
- #310CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization
CoRT는 토큰 수준의 크레딧 할당을 위해 카운터패클 레플레이를 활용한 GRPO 개선 방법으로, 평균 4.4%포인트 성능 향상을 보인다.
- #311HumanCLAW: Can Vision-Language Models Act Through a Body?
HumanCLAW는 VLM이 신체를 통해 행동하는 능력을 평가하는 프레임워크로, 16.8%의 성공률을 기록하며 현재 VLM이 신체 인식 부족으로 실패함을 밝힘.
- #312Voice Memory for Agentic Speech Recognition
Voice Memory는 추론 단계에서만 작동하는, 가시적이고 이동 가능한 음성 인식 정책을 구현하는 인프라-제로 인퍼런스 기반의 에이전트 음성 인식 시스템이다.
- #313ReDesign: Recovering Editable Design Structures from Images via Agentic Decomposition
ReDesign은 레이아웃, 색상, 텍스트 편집에서 편집 가능성 향상에 성공한 에이전트 기반 편집 가능한 디자인 복원 프레임워크이다.
- #314Large-Scale ChatBot Validation Through Customer Digital Twin Simulations
고품질 디지털 트윈 기반 고객 시뮬레이션으로 은행용 챗봇의 대규모 검증이 가능해진다.
- #315Registration-Grounded Spectral Fusion for Unregistered WLI/NBI Endoscopic Lesion Segmentation
미등록 WLI/NBI 내시경 이미지를 신뢰도 기반 복소 스펙트럼 융합으로 정확한 병변 분할하는 프레임워크 제안.
- #316DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text Space
DecoEvo는 텍스트 공간 최적화를 통해 LLM의 솔버와 루브릭 생성기를 점수와 독립적으로 공진화시켜 평가 성능을 향상시킨다.
- #317Explicit Layer Modeling for Video Object Insertion and Layer Decomposition
TriLayer 데이터셋과 DBL-Diffusion을 기반으로 영상의 레이어 구조를 명시적으로 모델링하여 객체 삽입과 분해 성능을 향상시킨다.
- #318Pass the Baton: Trajectory-Relayed On-Policy Distillation
Relay-OPD는 학생 모델의 오류 경로를 감지해 교사 모델이 국지적 개입을 수행함으로써, 전방위 학습 효율성을 향상시키는 새로운 온-정책 디스틸레이션 방법이다.
- #319Keep It InMind: Benchmarking the Implicit-Association Blind Spot in Agent Memory
InMind 벤치마크를 통해 기존 메모리 시스템의 암묵적 연관성 탐지 실패 문제를 분석하고, 이에 대한 실험적 결과를 제시한다.
- #320CAST: Game Solvers as Turn-Level Teachers for LLM Agents
CAST는 게임 솔버의 상태 가치 변화를 기반으로 LLM 에이전트의 턴 수준 신호를 생성하여 강화학습 성능을 향상시킨다.