- #1Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing
Magpie는 Llama-3-Instruct를 사용해 400만 개의 인스트럭션 데이터를 자동 생성하고, 이 중 30만 개의 고질량 데이터로 모델 퍼포먼스를 향상시키는 방식을 제안한다.
- #2NAVSIM: Data-Driven Non-Reactive Autonomous Vehicle Simulation and Benchmarking
NAVSIM은 비반응형 시뮬레이션과 대규모 데이터셋을 결합하여 자율주행 정책을 평가하는 새로운 벤치마킹 프레임워크이다.
- #3Pyramidal Flow Matching for Efficient Video Generative Modeling
파이라미달 플로우 매칭을 통해 768p 24fps 10초 영상을 20.7k A100 GPU 시간 내 생성하는 효율적 비디오 생성 모델 제안.
- #4GS-LRM: Large Reconstruction Model for 3D Gaussian Splatting
GS-LRM은 2~4장의 투영 이미지에서 0.23초 내 3D 가우시안을 생성하는 빠르고 확장 가능한 트랜스포머 기반 모델이다.
- #5From Slow Bidirectional to Fast Autoregressive Video Diffusion Models
CausVid는 비동기적 비디오 생성을 위한 자동 회귀 디퓨전 트랜스포머로, 9.4 FPS 속도로 30초 길이의 고해상도 비디오를 생성한다.
- #6Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean Data
RADD는 시간 조건을 제거한 이산 확장 확산 모델로, 5개 제로샷 언어 모델링 벤치마크에서 최고 성능을 달성했다.
- #7A StrongREJECT for Empty Jailbreaks
StrongREJECT은 기존 벤치마크보다 인간 평가와 높은 일관성을 보이는 새로운 제일브레이크 평가 기준을 제시한다.
- #8One Step Diffusion via Shortcut Models
Shortcut 모델은 단일 네트워크와 학습 단계로 1단계 생성이 가능한 확산 기반 생성 모델이다.
- #9Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning
Visual CoT는 438k 질문-답변 쌍을 포함한 대규모 데이터셋과 MLLM의 해석 가능성 향상을 위한 다단계 처리 파이프라인을 제안한다.
- #10TempCompass: Do Video LLMs Really Understand Videos?
TempCompass는 Video LLM의 시간 인지 능력을 체계적으로 평가하기 위한 새로운 벤치마크로, 8개의 최신 Video LLM이 시간 인지 능력에서 부족함을 드러냄.
- #296PhysCaP: Grounding Code-as-Policy Agent with Physics-Informed Exploration
PhysCaP는 물리 정보 기반 탐색을 도입한 Code-as-Policy 에이전트로, 물체의 질량과 강성 추정을 통해 효율적인 로봇 조작을 가능하게 한다.
- #302EnvHarness: Awakening Static Worlds for Agent Learning
EnvHarness는 정적 환경을 프로그래밍 가능한 레이어로 변환하여 에이전트 학습을 개선하는 시스템이다.
- #303GOAG: Generative and Object-Agnostic Grasp Planner for Dexterous Robotic Manipulation
GOAG는 객체-무관한 다지 다exterous 그립 계획을 위한 생성 모델로, MultiDex 데이터셋에서 86.93%의 성공률을 달성했다.
- #304FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis
FACET은 실행 가능한 터미널 태스크를 생성하면서 원본 의도와 실행 상태를 보존하는 프레임워크로, Terminal-Bench 2.1에서 47.57의 성능을 달성했다.
- #305τ_0-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation
τ₀-VLA는 세계 모델을 활용한 계산 확장 추론을 통해 장기적 로봇 조작 성능을 향상시키는 계층형 기반 모델이다.
- #306EXIMO: VLM Guided Exploration of VLA Policies
EXIMO는 VLM을 활용한 VLA 정책의 샘플 효율적 학습을 위한 3단계 알고리즘으로, 기존 방법 대비 성능과 효율성을 향상시킨다.
- #3074DAnyone: Create Anyone in 4D from a Casual Monocular Video
4DAnyone은 단일 카메라 영상에서 4D 인간을 재구성하는 프레임워크로, RCP와 TCR을 통해 다중 뷰 일관성을 달성한다.
- #308SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?
SWE-bench Science는 과학 소프트웨어 엔지니어링을 평가하기 위한 레포지토리 수준 벤치마크로, Claude Code with Opus-5 (max)의 pass@1이 50% 미만임을 보여준다.
- #309TinyCast: Probabilistic Zero-Shot Forecasting with Computed Periodicity
TinyCast는 146,505개의 파라미터로 주기성을 계산하고 확률적 예측을 제공하는 attention-free zero-shot 예측 모델이다.
- #310Decision Tree and K-Means Analysis of Raman Spectra for Edible Oils: A Physics-Informed AI Approach
람ان 분광과 결정 트리, K-평균 클러스터링을 결합한 물리 기반 AI를 활용한 식용유 인증 방법을 제시한다.
- #311WithEveryone: Unified Planning and Identity Grounding for Group Image Generation
WithEveryone은 최대 10명의 참조 신원을 포함한 그룹 이미지 생성을 위한 통합 프레임워크로, 신원 유지를 향상시키며 복사-붙여넣기 아티팩트를 감소시킨다.
- #312Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts
대규모 MoE 모델의 학습률 최적화를 위해 계산 효율적인 2단계 하이퍼파라미터 전이 프레임워크를 제안한다.
- #313MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use
MemTrapBench는 LLM의 메모리 사용 시 발생하는 인지 함정을 평가하는 벤치마크로, AdaptiveMem이라는 간단한 추론 시 보완 전략을 제안한다.
- #314InfinityEdit: Infinite Video Editing with a Lightweight Edit-Ignition Adapter
InfinityEdit은 무한 비디오 편집을 위한 경량 편집 어댑터로, 실시간 스트림에 편집을 지속적으로 적용하는 문제를 해결한다.
- #315SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback
SkillEvo는 다중 턴 인터랙션 피드백을 기반으로 신뢰할 수 있는 진화 경사를 생성하고, 구조적 지식 시스템을 유지하며 스킬을 지속적으로 개선하는 프레임워크이다.
- #316Graph Engineering in the Era of LLM Agents: From Individual Intelligence to System Intelligence
LLM 에이전트 시스템의 복잡성을 관리하기 위해 그래프 기반 구조를 도입한 System Intelligence와 Graph Engineering 패러다임을 제시한다.
- #317ParaTempo: Efficient Parallel Reasoning via Temporal Confidence
ParaTempo는 시간적 신뢰도를 기반으로 병렬 추론 과정을 효율적으로 제어하여, 수학 및 과학적 추론에서 21.8–32.2%의 지연 감소와 18.1–30.3%의 토큰 사용 감소를 달성한 비학습형 비동기 프레임워크이다.
- #318OmniAssistBench: Assistant-style Interaction Benchmark for Omni-LLMs
OmniAssistBench는 실시간 비디오 어시스턴트로 활용되는 Omni-LLMs의 상호작용 능력을 평가하기 위한 새로운 벤치마크로, 기존 모델들의 시각적 지시, 장기 기억, 지연 응답 등에서 한계를 드러냈다.
- #319ForgeWM: Progressive Causal Training for Few-Step Action-Conditioned Video World Models
ForgeWM은 게임 네이티브 컨트롤을 유지하면서 1~4단계의 저지연 동작 조건 비디오 월드 모델을 생성하는 프로그레시브 인과 학습 프레임워크이다.
- #320Repo0: Design-Driven Zero-to-All Code Generation
Repo0는 자연어 요구사항에서 전체 소프트웨어 프로젝트를 생성하는 구조적 진화 프레임워크이다.