- #1Memento 3: Model-Based Recursive Self-Improvement through Reflective Rulebooks
Memento 3는 자연어 규칙집을 기반으로 환경 모델을 학습하고 이를 코드로 변환하여 반복적으로 개선하는 모델 기반 자기 개선 프레임워크이다.
- #2InFoBench: Evaluating Instruction Following Ability in Large Language Models
InFoBench는 LLM의 지시사항 따르기 능력을 평가하기 위한 새로운 메트릭 DRFR과 500개의 지시사항을 포함한 벤치마크를 제시한다.
- #3Multi-Agent Egocentric World Model with Fine-Grained Embodied Interaction
ME-World는 다중 에이전트가 공유 환경에서 상호작용하는 상황에서 일관된 에고 스트림을 생성하는 다중 에이전트 에고 월드 모델이다.
- #4U-Space: Uncovering When and Why Uncertainty Arises in Language Models
U-Space는 언어 모델의 추론 과정에서 발생하는 불확실성을 측정하고 해석할 수 있도록 설계된 저차원 공간과 U-Lens를 제시한다.
- #5MAGIS: LLM-Based Multi-Agent Framework for GitHub Issue Resolution
MAGIS는 GitHub 이슈 해결을 위한 LLM 기반 멀티에이전트 프레임워크로, GPT-4 대비 8배 높은 해결률을 달성했다.
- #6GPT-4V(ision) is a Human-Aligned Evaluator for Text-to-3D Generation
GPT-4V를 활용해 텍스트-3D 생성 모델의 인간 정렬 평가 메트릭을 구축하고, Elo 점수를 통해 모델을 자동 평가하는 시스템을 제안한다.
- #7CycleNet: Enhancing Time Series Forecasting through Modeling Periodic Patterns
CycleNet은 주기적 패턴을 명시적으로 모델링하여 장기 시계열 예측 성능을 향상시키는 간단하면서도 강력한 방법이다.
- #8Learning Smooth and Expressive Interatomic Potentials for Physical Property Prediction
eSEN이라는 새로운 MLIP 모델이 에너지 보존 능력을 기반으로 물리적 성질 예측 성능을 SOTA 수준으로 향상시킨다.
- #9ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models
ProRL은 KL divergence 제어와 reference policy reset을 통해 기존 모델 분포를 벗어난 새로운 추론 전략을 발견하는 장기 강화학습 방법이다.
- #10T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT
T2I-R1은 강화 학습 기반의 이중 수준 CoT를 도입하여 텍스트-이미지 생성 성능을 13~19% 향상시킨 모델이다.
- #11Generalizing Verifiable Instruction Following
IFBench라는 새로운 벤치마크를 제시하며, RLVR 기반 학습이 정밀 지시사항 준수 성능을 15% 이상 향상시킨다.
- #12LLM Maybe LongLM: Self-Extend LLM Context Window Without Tuning
SelfExtend는 미세조정 없이 기존 LLM의 컨텍스트 윈도우를 확장하는 새로운 방법으로, 그룹 어텐션과 이웃 어텐션을 기반으로 한다.
- #13Windows Agent Arena: Evaluating Multi-Modal OS Agents at Scale
Windows Agent Arena는 Windows OS 내에서 다중 모달 에이전트를 대규모로 평가하는 벤치마크 환경으로, Navi 에이전트의 성능을 19.5%의 성공률로 평가한다.
- #53Foundations of Large Language Models
BERT 모델의 기본 아키텍처와 하이퍼파라미터 설정을 설명하며, LLM 개발의 기초를 다룬다.
- #291A GPU-Parallel Framework for Heterogeneous Multi-Task Reinforcement Learning
Hebero는 GPU-병렬 환경에서 이질적 다중 작업 강화 학습을 위한 벤치마크와 DGPO 알고리즘을 제시하여 90.1%의 성공률을 달성한다.
- #306MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement
MiMo-V2.6은 대규모 강화학습을 통해 모델 스스로를 개선하는 방향으로 확장한 다모달 강화학습 프레임워크이다.
- #307WorldGuide: Goal-Directed Video World Model for Procedural Task Execution
WorldGuide는 시각적 세계 공간에서 닫힌 루프 태스크 실행을 통해 절차적 동영상 생성을 수행하는 모델로, WorldGuide-Bench에서 33.33%의 태스크 성공률을 달성했다.
- #308SPW-Nav: A Streaming Panoramic World Model for Language-Guided Navigation
SPW-Nav는 언어 지시에 따라 2K 해상도 360° 영상을 실시간 스트리밍하는 세계 모델로, 26.6 FPS 속도로 1분 동안 연속 생성한다.
- #309OuroWorld: Bringing Any 3D World Alive as Diverse, Endlessly Looping 3D Cinemagraphs
OuroWorld는 3D Gaussian Splatting 장면을 마스크 없이 루프되는 3D 씨네그래프로 변환하는 프레임워크로, 39개 장면에서 70.8%–99.0% 사용자 선호도를 달성했다.
- #310Beyond Spatio-Temporal Priors: A Generalizable Approach for Dense Correspondence Matching
FreeMatching은 기존의 시공간 가정을 벗어난, IEG 환경에서도 정확한 신원 보존 대응을 가능하게 하는 일반화된 대응 매칭 프레임워크이다.
- #311MC-Sparse: Deconstructing and Closing the Dense-Sparse Attention Gap in Diffusion Transformers
MC-Sparse는 토큰 수준의 정밀한 어텐션 선택과 타일 정렬 그룹핑을 결합한 훈련 없이 가능한 확산 트랜스포머 가속 프레임워크로, 1.80×~2.32×의 가속 성능을 보인다.
- #312TestPrism: Rethinking Test Evaluation Beyond a Single Reference
TestPrism은 단일 참조 기반 테스트 평가의 한계를 극복하기 위해 300개 테스트 태스크와 3000개 후보 구현을 포함한 새로운 평가 프레임워크를 제시한다.
- #313Synthesis Through Simulation: Generating Coherent Enterprise Data via Scalable Agent-System Interaction
STS는 정책 강제 API를 활용한 시뮬레이션 기반 데이터 생성으로, 10개 기업 환경에서 100% 제약 만족과 0.88 평균 마진 페르미티를 달성한 도메인 비특화 에이전트 GP를 제시한다.
- #314Post-Training Frontier Text-to-Image Models by Composing Preference and Rubric Rewards
이 연구는 선호도와 기준 기반 보상 신호를 결합한 후학습 전략을 통해 텍스트-이미지 생성 모델의 성능을 개선한다.
- #315OneSearch-VL: Unified Multimodal Deep Research Agent for Image and Video
OneSearch-VL은 단일 이미지, 다중 이미지, 동영상의 딥 리서치를 통합하는 새로운 에이전트로, VGEG 기반 데이터 엔진과 EVGR 보상을 통해 성능을 크게 향상시킨다.
- #316Pumpire: Unified Benchmark for Metric Distance Estimation
Pumpire는 3D 기초 모델의 점-점 거리 추정 능력을 직접 평가하는 통합 벤치마크로, 6,400개의 실제 장면 데이터와 29개 기준 모델 실험을 통해 정확도를 분석한다.
- #317Embodied Turing Machines: Stateful Code for Robot Recursive Self-Improvement
COAP는 로봇 정책을 코드로만 구현하여 재귀적 자기 개선(RSI)을 가능하게 하는 새로운 패러다임이다.
- #318SparseEngine: Sparse-First Inference Engine
SparseEngine는 다양한 스파스 인퍼런스 메서드를 통합한, 키-벨류 캐시 관리와 높은 처리 성능을 제공하는 스파스-퍼스트 인퍼런스 엔진이다.
- #319OmniCapBench: A Deep-Structured Evaluation Framework for Fine-Grained Audio-Visual Captioning
OmniCapBench는 MLLM의 오디오-비주얼 캡션 생성 능력을 세부적으로 평가하기 위한 딥-스트럭처드 평가 프레임워크로, 786개의 밀집 어노테이션 영상과 세 가지 평가 트랙을 통해 구조적 정확도와 세부적 의미 정확도를 분리 평가한다.
- #320Do LLMs Understand Sequential Structure? A Controlled Study of Inference and Generation
LLMs가 표면 행동 통계 이상의 순차 구조를 이해하는지 실험적으로 검증한 연구.