- #1ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search
ZGCM-1은 73억 파라미터의 오픈소스 기반 모델로, 256K 컨텍스트에서 수학적 추론과 에이전트 검색 성능을 극대화한 효율적인 학습 레시피를 제시한다.
- #2Expandable Subspace Ensemble for Pre-Trained Model-Based Class-Incremental Learning
EASE는 사전 학습 모델 기반의 클래스 증분 학습에서 과거 지식을 유지하면서 새로운 클래스를 학습하는 확장 가능한 서브스페이스 앙상블 방법을 제안한다.
- #3A Comprehensive Survey of Hallucination in Large Language, Image, Video and Audio Foundation Models
대규모 기초 모델(FMs)에서 발생하는 환각(hallucination) 문제를 다중 모달에서 체계적으로 분류하고 해결 방안을 제시한 종합적 서베이 논문.
- #4A derivative-fidelity failure mode in physics-informed neural networks: strengthened benchmark evidence from function-value training
PINNs에서 함수값 정확도가 미분 정확도를 보장하지 않는 실패 모드를 제시한다.
- #5MLVU: Benchmarking Multi-task Long Video Understanding
MLVU는 장시간 동영상 이해 능력을 종합적으로 평가하기 위한 다중 작업 벤치마크로, 기존 한계를 극복하고 MLLM의 성능을 체계적으로 분석한다.
- #6Efficient LoFTR: Semi-Dense Local Feature Matching with Sparse-Like Speed
Efficient LoFTR는 LoFTR의 효율성 문제를 해결하며, 2.5배 빠른 속도로 준밀도 매칭 성능을 향상시킨다.
- #7WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild
WildBench는 실제 사용자 채팅 로그에서 추출한 1,024개의 과제를 기반으로 LLM을 평가하는 자동 평가 프레임워크로, WB-Reward와 WB-Score라는 두 메트릭을 통해 높은 신뢰도의 자동 평가를 제공한다.
- #8Pelican-Sim 1.0: A General World Model Simulator for Embodied Intelligence
- #9VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time
VASA-1은 단일 정적 얼굴 이미지와 음성 입력으로 실시간으로 생생한 말하는 얼굴 영상을 생성하는 모델로, 높은 품질과 40 FPS의 처리 속도를 제공한다.
- #10Arcee’s MergeKit: A Toolkit for Merging Large Language Models
MergeKit은 대규모 언어 모델의 체크포인트를 병합하여 다중 작업 성능을 향상시키는 오픈소스 툴킷이다.
- #11MDAgents: An Adaptive Collaboration of LLMs for Medical Decision-Making
MDAgents는 복잡한 의료 결정 과제에서 LLM들의 협업 구조를 자동화하여 7/10 벤치마크에서 최고 성능을 달성한 의료 AI 프레임워크이다.
- #12VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents
VisRAG는 VLM을 기반으로 문서를 직접 이미지로 임베딩하여 RAG 파이프라인의 정보 손실을 줄이고, 20~40%의 종단간 성능 향상을 달성한 다중 모달 문서 처리 기법이다.
- #13Multi-Modal Hallucination Control by Visual Information Grounding
M3ID는 VLM의 환상 생성을 감소시키는 무학습 추론 시 간섭 방법으로, 시각적 정보와의 상호정보를 최대화하여 언어 사전에 대한 과도한 의존성을 줄인다.
- #286Vidu S2: Real-Time Interactive, Editable, and Spatial Video Generation
Vidu S2는 실시간 인터랙티브 아바타 생성과 편집 기능을 갖춘 실시간 영상 생성 모델로, 720p 해상도와 다이내믹 레퍼런스, 강화된 인스트럭션 팔로잉을 지원한다.
- #289Agent as Policy for Robotic Manipulation
Agent as Policy (AGP)는 일반적인 에이전트를 로봇 정책으로 활용하여, 실물 조작에서 100% 성공률을 달성하는 시스템이다.
- #291Atria Dawn: The Dawn of Agentic Superintelligence
Atria Dawn Preview는 744억 파라미터 MoE 기반의 연구 및 엔지니어링용 에이전트 언어 모델로, 인간-에이전트 협업을 통해 16개 벤치마크에서 경쟁력을 보였다.
- #301Planning or Learning: Reliability and Cost in Multi-Asset Maintenance
다중 자산 유지보수에서 계획(planning)과 강화학습(RL)의 신뢰성과 비용 효율성 비교를 통해 보완적인 접근법임을 밝힘.
- #308Dream-RSI: Recursive Self-Improvement through Evolving Worlds
Dream-RSI는 과거 탐색 기록을 재생 시뮬레이터로 활용해 메타-탐색 정책을 저비용으로 개선하는 반복적 자기 개선 프레임워크이다.
- #309Occamy-1.0: Open Pareto-frontier 35B Intelligence for Co-work
Occamy-1.0은 Qwen3.6-35B-A3B 기반으로 훈련된 35B 파라미터 규모의 효율적 공동작업 에이전트 모델이다.
- #310PhysBrain 1.5: From Vision-Language Models to Physical Foundation Models
PhysBrain 1.5는 8B 규모로 28개의 체화된 평가에서 평균 72.5 점을 달성한 오픈소스 물리 기초 모델이다.
- #311AlayaVista: Streaming World Modeling from Panoramic States to Perspective Video
AlayaVista는 패러메트릭 카메라 제어를 통해 패러스펙티브 영상 생성과 팬오라마 세계 모델링을 분리한 실시간 스트리밍 비디오 월드 모델이다.
- #312DataFlex-RL: An Evaluation Platform for RLVR Data Policies
DataFlex-RL은 RLVR 데이터 정책을 비교하는 평가 플랫폼으로, 다양한 설정에서 균일 샘플링 대비 일관된 성능 향상이 없음을 밝힘.
- #313E2A-Bench: Benchmarking Evidence-to-Action Reliability in Financial Chart Reasoning
E2A-Bench는 금융 차트 추론에서 증거-행동 신뢰도를 평가하는 969개 질문을 포함한 벤치마크로, 기존 홀루시네이션 점수의 한계를 드러낸다.
- #314MobileVLA-R1 2.0: RL-Enhanced Reasoning for Mobile Robot Control
MobileVLA-R1 2.0은 강화학습을 결합한 VLA 프레임워크로, 언어-비전-작업 실행 일관성을 향상시킨다.
- #315Grouped Value Attention: Efficient KV Caching via On-Demand Key Reconstruction
GVA는 KV 캐시 공간을 45-47% 절감하면서 GQA 수준의 성능을 유지하는 새로운 어텐션 메커니즘이다.
- #316LynnReal-Omni: Native multi-modal Video Generation for Agentic Visual Workflows
- #317ReactHuman: A Physics-Grounded Benchmark for Human-Like Reactive Decision-Making in Embodied Multimodal LLMs
- #318StepAudio 3 Gen Technical Report
StepAudio 3 Gen은 단일 프레임워크 내에서 다양한 오디오 생성을 지원하는 이산 자가회귀 모델로, RVQ 토크나이저와 RVQ Adaptor를 통해 TTS 및 보이스 디자인에서 최고 성능을 달성한다.
- #319Attention-DP3: Spatially Object-aware 3D Diffusion Policy via Geometry-aligned Attentional Conditioning
Attention-DP3는 3D 포인트 클라우드에서 객체 인식을 강화한 디퓨전 정책으로, MetaWorld에서 73% 성공률을 달성했다.
- #320Dynin-Robotics: Omnimodal Unified Diffusion Vision-Language-Action Model
Dynin-Robotics는 언어-비주얼-액션을 통합한 공유된 마스킹 확산 모델로, 78.4%의 성공률을 달성하고 29.2× 가속화된 액션 디코딩을 지원한다.