- #1TimeMixer++: A General Time Series Pattern Machine for Universal Predictive Analysis
TimeMixer++는 다중 스케일과 주파수 분해능을 활용해 8가지 시계열 분석 작업에서 최고 성능을 달성한 시계열 패턴 머신이다.
- #2Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning
Code-as-World는 실행 가능한 코드로 물리적 세계를 표현하는 새로운 패러다임으로, VLM의 정량적 물리적 추론 성능을 크게 향상시킨다.
- #3Revisiting Local Context for Long-Horizon Streaming 3D Reconstruction
ABot-Recon은 11프레임의 로컬 컨텍스트만 사용해 장거리 스트리밍 3D 재구성을 안정적으로 수행하는 모델로, Oxford Spires에서 ATE 4.35m, RPE-R 0.12°를 달성한다.
- #5LongVILA: Scaling Long-Context Visual Language Models for Long Videos
LongVILA는 2048개의 비디오 프레임을 처리하며 99.8% 정확도를 달성한 장거리 컨텍스트 VLM과 MM-SP 시스템을 결합한 종합 솔루션입니다.
- #6Agent Security Bench (ASB): Formalizing and Benchmarking Attacks and Defenses in LLM-based Agents
Agent Security Bench(ASB)는 LLM 기반 에이전트의 보안 취약점을 체계적으로 평가하기 위한 벤치마크 프레임워크로, 84.30%의 높은 공격 성공률을 기록하며 방어 기법의 한계를 드러낸다.
- #7VastGaussian: Vast 3D Gaussians for Large Scene Reconstruction
VastGaussian은 대규모 장면의 고해상도 재구성과 실시간 렌더링을 위한 3D 가우시안 스플래팅 기반 최초의 방법이다.
- #8Absolute Zero: Reinforced Self-play Reasoning with Zero Data
AZR은 외부 데이터 없이 자가 생성 학습을 통해 수학 및 코드 추론에서 최신 성능을 달성한 RLVR 모델이다.
- #9Does Fine-Tuning LLMs on New Knowledge Encourage Hallucinations?
LLM 미세조정 시 새로운 지식 도입은 학습 속도를 저하시키고, 환각 발생률을 증가시킨다.
- #10LayerSkip: Enabling Early Exit Inference and Self-Speculative Decoding
LayerSkip는 LLM 추론 속도를 1.82~2.16× 가속화하는 end-to-end 솔루션으로, early exit과 self-speculative decoding을 결합한 기법이다.
- #11Unlocking Efficiency in Large Language Model Inference: A Comprehensive Survey of Speculative Decoding
스펙ulative 디코딩을 통해 대규모 언어 모델의 추론 효율성을 향상시키는 방법을 체계적으로 조사하고 분석한다.
- #12Infinity∞: Scaling Bitwise AutoRegressive Modeling for High-Resolution Image Synthesis
Infinity는 비트단위 토큰 예측을 기반으로 고해상도 이미지 생성 성능을 획기적으로 향상시킨 오토회귀 모델이다.
- #13Chain of Thought Empowers Transformers to Solve Inherently Serial Problems
CoT(Chain of Thought)를 통해 트랜스포머가 직렬 계산 문제를 해결할 수 있는 이론적 근거와 실증적 증거를 제시한다.
- #296Fast Weight Attention for Continual Learning
Fast Weight Attention을 활용한 연속 학습 방법론을 제안하고, 언어 모델링 및 수치 연산에서 성능을 검증한다.
- #305Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models
VLAct는 제한된 로봇 데이터로 전이 가능한 시각-행동 표현을 학습하는 VLA 모델의 지속적 사전 학습 방법이다.
- #309LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering
LoopArena는 코드 작성 에이전트를 장기 과제에서 효과적으로 제어하는 모델의 능력을 평가하는 벤치마크이다.
- #312DART-SD: Diamond-topology Aware Retrieval and Tuning for Self-Distillation of Multi-Turn Tool-Calling Agents
DART-SD는 다중 턴 툴 호출 에이전트의 자기 교사 학습을 위해 다이아몬드 토폴로지를 고려한 새로운 프레임워크로, 정확도와 정책 다양성을 동시에 향상시킨다.
- #313Agentic Artifact Creation: Systems, Evaluation, Principles, and Opportunities
지능형 에이전트가 생성물을 상태를 유지하면서 구축하고 수정하는 과정을 체계적으로 분석한 조사 연구.
- #316J-Zero: Unified Challenger--Solver--Judge Co-Evolution from Zero Data
J-Zero는 제로데이터에서 시작하여 Challenger-Solver-Judge가 공진화하는 프레임워크로, 검증 가능한/불가능한 도메인에서 평균 4.2~8.0점 개선을 달성한다.
- #319Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090
Puro-2B는 RTX 5090 GPU와 FP8 정밀도를 활용해 6,900달러 미만에 훈련된 2B 파라미터 언어 모델로, Qwen2.5-1.5B 수준의 성능을 달성한다.
- #320LayerRecall: A State-Conditioned Memory Router for Long-Horizon Consistency in Video Generation
LayerRecall은 장기 기억을 효과적으로 활용해 동영상 생성의 장기 일관성을 향상시키는 레이어 선택적 메모리 라우터를 제안한다.
- #321Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models
INDI는 VLA 모델의 액션 디코더에 행동 수준의 의도를 증류하여 성능과 일반화 능력을 향상시킨다.
- #322ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL
ContextPilot은 롱-호리즌 에이전트 작업에서 컨텍스트 관리를 강화하기 위해 RL 기반의 세부적인 프레임워크를 제안한 연구이다.
- #323WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution
WikiSkill은 지속적인 지식 축적을 통해 에이전트의 스킬 진화를 촉진하는 프레임워크로, 다양한 벤치마크에서 기존 방법을 상회한다.
- #325CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes
CritICL은 약한 모델의 실패 패턴을 활용해 강한 모델의 추론 성능을 향상시키는 추론 시 효율적인 프레임워크이다.
- #326Locate Anything in Videos: Rethinking Efficient Generative Spatio-Temporal Video Grounding
Parallel Tube Decoding(PTD)를 제안하여 영상 내 시공간 객체 추적의 효율성과 정확도를 동시에 향상시킨다.
- #327Blind Men and the Elephant: Probing the Epistemic Myopia of LLMs under Long-Tail Divergent Knowledge
ElephantBench는 LLM이 극소수의 정보를 기억하는 능력을 평가하기 위한, 다중 정답을 가진 폐쇄형 지식 탐지 벤치마크이다.
- #328Paint What You See: Benchmarking Dexterous Visual Tool Use in Multimodal Agents
EASEL은 시각적 정밀도가 요구되는 다중 모달 에이전트의 도구 사용 능력을 평가하는 새로운 벤치마크로, 440,000개 샘플의 EASEL-Data와 9B 파라미터 모델 EASEL-9B를 제시한다.
- #329StepGuard: Learning Step-Level Guardrails with Scalable Supervision and Safety-Utility Balancing
StepGuard는 실행 전 단계에서 도구 행동을 점검하는 스텝 레벨 가드 모델로, AgentDojo와 AgentDyn에서 77.3%의 공격 성공률 감소를 달성했다.
- #330Luce: Relightable Gaussians for 3D Asset Generation
Luce는 이미지에서 재조명 가능한 3D 자산을 생성하기 위한 다중 모달 PBR 가우시안 표현을 제안하며, 기존 기법 대비 28% 개선된 FID 성능을 보인다.
- #332Sliding-window beats linear attention
슬라이딩 윈도우 어텐션(SWA)이 포스트 트레이닝된 라인어 어텐션 모델보다 성능이 우수하며, 추가 학습 없이도 높은 효율성을 보인다.