- #1ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search
ZGCM-1은 73억 파라미터의 오픈소스 기반 모델로, 256K 컨텍스트에서 수학적 추론과 에이전트 검색 성능을 극대화한 효율적인 학습 레시피를 제시한다.
- #2CODI: Compressing Chain-of-Thought into Continuous Space via Self-Distillation
CODI는 자연어 사고 과정을 연속 공간으로 압축해 GPT-2 규모에서 3.1배 압축률과 28.2% 정확도 향상을 달성한 새로운 사고 방식 학습 프레임워크이다.
- #3Direct3D: Scalable Image-to-3D Generation via 3D Latent Diffusion Transformer
Direct3D는 이미지-3D 생성에서 다뷰 확산 모델이나 SDS 최적화 없이, 3D 잠재 공간 기반의 생성 모델을 통해 새로운 기준점을 제시한다.
- #4CharXiv: Charting Gaps in Realistic Chart Understanding in Multimodal LLMs
CharXiv는 실제 과학 논문에서 추출한 2,323개의 다양한 차트를 기반으로 MLLM의 차트 이해 능력을 평가하는 새로운 벤치마크로, GPT-4o와 InternVL Chat V1.5 간 17.9%의 성능 격차를 드러낸다.
- #5Applying Guidance in a Limited Interval Improves Sample and Distribution Quality in Diffusion Models
이 연구는 확산 모델에서 가이던스를 제한된 노이즈 구간에만 적용함으로써 샘플 품질과 추론 속도를 동시에 향상시킨다.
- #6LLMs Know More Than They Show: On the Intrinsic Representation of LLM Hallucinations
LLMs는 내부 표현에 사실성 정보를 다량 포함하고 있으나, 이 정보는 특정 토큰에 집중되어 있으며, 태스크별로 일반화되지 않는다.
- #7LLM-Assisted Static Analysis for Detecting Security Vulnerabilities
IRIS는 GPT-4와 정적 분석을 결합한 신경-기호적 접근법으로, Java 프로젝트에서 보안 취약점을 55개 탐지하며 기존 도구 대비 103.7% 개선.
- #8KernelBench: Can LLMs Write Efficient GPU Kernels?
KernelBench는 LLM이 효율적인 GPU 커널을 생성할 수 있는지 평가하는 오픈소스 프레임워크로, 250개 PyTorch 워크로드에서 기능적 정확성과 속도 향상을 측정한다.
- #9Foundation Models for Time Series Analysis: A Tutorial and Survey
시계열 분석을 위한 Foundation Models(FMs)의 최신 연구와 방법론적 분류를 체계적으로 정리한 서베이 논문.
- #10Mitigating Hallucinations in Large Vision-Language Models with Instruction Contrastive Decoding
ICD는 LVLM의 환각을 줄이기 위해 표준 및 교란 지시문의 분포를 대비하는 새로운 추론 방법이다.
- #11NVILA: Efficient Frontier Visual Language Models
NVILA는 "scale-then-compress" 전략을 통해 정확도와 효율성을 동시에 최적화한 오픈 소스 비주얼 언어 모델이다.
- #285Atria Dawn: The Dawn of Agentic Superintelligence
Atria Dawn Preview는 744억 파라미터 MoE 기반의 연구 및 엔지니어링용 에이전트 언어 모델로, 인간-에이전트 협업을 통해 16개 벤치마크에서 경쟁력을 보였다.
- #286Agent as Policy for Robotic Manipulation
Agent as Policy (AGP)는 일반적인 에이전트를 로봇 정책으로 활용하여, 실물 조작에서 100% 성공률을 달성하는 시스템이다.
- #297Planning or Learning: Reliability and Cost in Multi-Asset Maintenance
다중 자산 유지보수에서 계획(planning)과 강화학습(RL)의 신뢰성과 비용 효율성 비교를 통해 보완적인 접근법임을 밝힘.
- #302Continual Learning Mechanisms Compose for Long-Horizon Memorization
100개의 순차적 작업 학습에서 34.9%의 최종 기억률을 달성한 복합 메커니즘 조합 연구.
- #306PhysBrain 1.5: From Vision-Language Models to Physical Foundation Models
PhysBrain 1.5는 8B 규모로 28개의 체화된 평가에서 평균 72.5 점을 달성한 오픈소스 물리 기초 모델이다.
- #307Root-Cause Attribution Is a Search Problem: Continual Search for Long-Horizon Agent Failures
긴 시간 범위의 에이전트 실패 원인을 추적하는 문제를 반복적 탐색 프레임워크로 해결하여 GPT-5.5의 F1 점수를 0.349에서 0.498로 40% 이상 향상시킨다.
- #308AlayaVista: Streaming World Modeling from Panoramic States to Perspective Video
AlayaVista는 패러메트릭 카메라 제어를 통해 패러스펙티브 영상 생성과 팬오라마 세계 모델링을 분리한 실시간 스트리밍 비디오 월드 모델이다.
- #309AI for Games in the Foundation Model Era
게임 AI 분야에서 기초 모델이 다양한 역할을 수행하며, 그간 분리되어 발전한 연구 주제들이 통합되고 있다.
- #310E2A-Bench: Benchmarking Evidence-to-Action Reliability in Financial Chart Reasoning
E2A-Bench는 금융 차트 추론에서 증거-행동 신뢰도를 평가하는 969개 질문을 포함한 벤치마크로, 기존 홀루시네이션 점수의 한계를 드러낸다.
- #311StepAudio 3 Realtime Technical Report
StepAudio 3 Realtime은 Think-While-Speaking을 통해 실시간 대화 중 사고와 응답을 병행하는 오디오-언어 기반 모델로, MMSU 90.6, τ-Voice 56.0% 등 주요 지표에서 뛰어난 성능을 보인다.
- #312The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement
AI가 경험을 기반으로 스스로 개선하는 RSI 개념을 제시하고, 구현 단계와 주요 도전점을 분석한다.
- #313StepAudio 3 Music Technical Report
StepAudio 3 Music은 ABC-CoT 기반의 음악 계획과 텍스트 제어를 지원하는 대규모 장시간 음악 생성 모델이다.
- #314RSIAgent: Autonomous Exploration for Recursive Self-improvement in New Environments
RSIAgent는 새로운 환경에서 모델 파라미터 업데이트 없이 자율적으로 메모리를 구축하고 재사용하는 다중 에이전트 프레임워크이다.
- #315Grouped Value Attention: Efficient KV Caching via On-Demand Key Reconstruction
GVA는 KV 캐시 공간을 45-47% 절감하면서 GQA 수준의 성능을 유지하는 새로운 어텐션 메커니즘이다.
- #316LLMs as Master Forgers: Generating Synthetic Time Series Data for Manufacturing
LLM을 활용한 제조 공정 시계열 데이터 생성 프레임워크를 제안한다.
- #317LynnReal-Omni: Native multi-modal Video Generation for Agentic Visual Workflows
LynnReal-Omni는 32B 다중 모달 디퓨전 트랜스포머를 기반으로, 텍스트-비디오 생성부터 게임 기록까지 다양한 입력을 통합 처리하는 통합형 비디오 생성 프레임워크이다.
- #318Dynin-Robotics: Omnimodal Unified Diffusion Vision-Language-Action Model
Dynin-Robotics는 언어-비주얼-액션을 통합한 공유된 마스킹 확산 모델로, 78.4%의 성공률을 달성하고 29.2× 가속화된 액션 디코딩을 지원한다.
- #319How Lossless Is Lossless Speculative Decoding? The Role of Numerical Precision in Orthrus
Orthrus는 BF16 정밀도에서 43~45%의 정확한 추론 경로 일치율을 보이며, 수치 정밀도가 "무손실 추론"의 실현에 결정적임을 밝힌다.
- #320Disentangling Representation Evolution in Transformers through Directional Decomposition
Transformer의 표현 진화를 방향 분해를 통해 분석하고, 편집, 압축, 학습 과정에서의 영향을 실증적으로 규명한다.