- #2RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation
RDT-1B는 이중 팔 조작을 위한 확산 기반 기초 모델로, 1.2B 파라미터와 6K+ 에피소드로 학습하여 제로샷 및 퓨샷 학습 성능을 크게 향상시킨다.
- #3Wavelet Convolutions for Large Receptive Fields
Wavelet Transform을 활용한 WTConv 레이어로, 과매개변수화 없이 대규모 수용 필드를 구현한다.
- #43D-VLA: A 3D Vision-Language-Action Generative World Model
3D-VLA는 3D 비전-언어-행동 생성 세계 모델로, 2D 기반 VLA 모델의 한계를 극복하고 3D 환경에서의 추론과 행동 계획을 강화한다.
- #5Vista: A Generalizable Driving World Model with High Fidelity and Versatile Controllability
Vista는 고해상도 예측과 다중 조작 가능성을 갖춘 일반화 가능한 자율 주행 월드 모델로, 기존 모델 대비 55% 개선된 FID 성능을 보인다.
- #6Genie: Generative Interactive Environments
Genie는 11B 파라미터를 가진 비지도 학습 기반 생성형 상호작용 환경 모델로, 텍스트, 이미지, 스케치 등으로 제어 가능한 가상 세계를 생성한다.
- #7GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models
GSM-Symbolic 벤치마크를 통해 LLM의 수학적 추론 능력 한계를 실증적으로 분석하고, 수치 변화와 불필요한 정보에 대한 취약성을 밝혀냄.
- #8From Generation to Judgment: Opportunities and Challenges of LLM-as-a-judge
LLM-as-a-judge 패러다임을 통해 기존 평가 방법의 한계를 극복하고, 다양한 NLP 태스크에서 LLM을 활용한 판단과 평가를 체계적으로 정리한다.
- #9YOLOv10: Real-Time End-to-End Object Detection
YOLOv10은 NMS 제거와 효율-정확도 균형 설계를 통해 실시간 엔드투엔드 객체 탐지 성능을 대폭 향상시킨 새로운 YOLO 시리즈이다.
- #10CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
CoT-VLA는 시각적 사고 과정을 통합한 7B 규모의 최신 VLA 모델로, 실제 조작 작업에서 기존 최고 모델 대비 17% 개선된 성능을 보인다.
- #12Scaling Rectified Flow Transformers for High-Resolution Image Synthesis
고해상도 텍스트-이미지 생성을 위해 Rectified Flow Transformer를 확장한 연구.
- #47Physically Verifiable Evidence and LLM-Based Reporting for Bearing Fault Diagnosis
안전-critical 시스템에서 신뢰성 있는 AI 진단을 위해 물리적 검증 가능한 증거와 LLM 기반 보고를 결합한 새로운 접근법을 제시한다.
- #304Kimi K3: Open Frontier Intelligence
Kimi K3는 2.8T 파라미터 MoE 모델로, Kimi K2 대비 2.5배 향상된 확장 효율성을 보인다.
- #308The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation
다중 턴 장기 계획 능력을 구조화된 환경에서 3단계로 분석하고, MOPD를 통해 통합하는 방법을 제시한다.
- #309JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents
JarvisHub는 캔버스 기반의 창의적 에이전트 허브로, 장기적 멀티모달 창작 과정을 관리하고 추적 가능하게 만든다.
- #312Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation
On-policy diffusion distillation에서 classifier-free guidance 조건 하의 지도 효과를 개선하기 위해 Positive–Direction Matching(PDM)을 제안한다.
- #316Codifying the Judge: Scalable Evaluation via Program Distillation
PAJAMA는 LLM 평가를 프로그램으로 변환하여 비용, 속도, 투명성을 동시에 개선하는 새로운 평가 프레임워크이다.
- #318Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification
Sol-Attn은 비용 효율적인 동적 어텐션 스파스화를 통해 동영상 생성 추론 속도를 2.1~2.3배 향상시킨다.
- #319OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation
OmniVAE는 오디오-비디오 생성을 위한 통합 VAE로, 세그먼트 수준 대비 학습과 사전 학습 특징 증류를 통해 다중 모달 대응성을 향상시킨다.
- #321Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On
Oxygen-TryOn은 다양한 의류와 액세서리를 포함한 항목을 정밀하게 시뮬레이션하는 통합 가상 시착 모델로, 기존 시스템보다 뛰어난 일관성과 사실감을 보인다.
- #324IndicTalk: A Large-Scale Persona-Based Multilingual Conversational Corpus for Indic Languages
IndicTalk은 인도 언어 대화 자료의 부족을 해결하기 위한 대규모 다국어 코드-믹스 대화 코퍼스이다.
- #328Predicting the Outcome of rTMS Depression Therapy using EEG Signals and CNN
rTMS 치료 반응 예측을 위해 FBSE-ED 기반 EEG 이미지와 커스텀 CNN을 활용한 연구.
- #329Evaluating the Impact of Reviewer Guideline Design on LLM-Based Automated Peer Review
LLM 기반 자동 학술 심사에서 심사 가이드라인 설계가 결과에 미치는 영향을 평가한 연구.
- #330Visible-Light Imaging Diagnosis of Neutral Particle Emission Tomography in the Tokamak Divertor: An Efficient Transformer-based Surrogate Model
Delta-InvFormer는 EAST 토카막에서 중성입자 방출 톰ограф리 분포를 빠르고 정확하게 재구성하는 Transformer 기반 서러지 모델이다.
- #331Multi-Head Latent Control: A Unified Interface for LLM Agent Decision Making
Multi-Head Latent Control은 기존 LLM을 수정하지 않고도 추론 시점의 제어 결정을 개선하는 경량 레이어를 제안한다.
- #332TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward
TILT는 텍스트-이미지 생성 모델에서 복합 조합 프롬프트에 대한 생성을 개선하기 위해 추론 시점에서 모델 고유의 보상 함수를 활용하는 훈련 없이 작동하는 프레임워크이다.
- #333dRAE: Representation Autoencoder with Hyper-Spherical Codes
dRAE는 고차원 시각 표현을 언어 모델과 연결하기 위해 하이퍼스피어리컬 코드를 사용하는 디스크리트 오토인코더로, 코드북 콜랩스 문제를 해결한다.
- #334IDEAgent: Agentic Quality-Diversity Search for Research Idea Generation
IDEAgent는 과학적 아이디어 생성을 Quality-Diversity(QD) 탐색으로 모델링한 다중 에이전트 프레임워크로, 32개 주제에서 Yield 지표 기준 3.89배 성능 향상을 보인다.
- #335Reasoning Denoiser: Denoising Reasoning Traces for Hallucination Detection in Large Reasoning Models
ReDe는 대규모 추론 모델의 추론 트레이스에서 노이즈 단계를 제거하여 환상 생성 감지 성능을 18.69% 향상시키는 학습 프레임워크이다.
- #336Chamaileon: Cross-Context Binder Design with Contextualized Modeling and Mixed Sampling
Chamaileon은 다중 타겟 및 다중 상태 단백질 결합체 설계를 위한 새로운 프레임워크로, I3CD와 MoPS를 통해 다양한 구조적 맥락에서 유연한 결합체를 생성한다.
- #337ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding
ClinFusion은 2D 및 3D 의료 이미지를 통합 처리하는 Vision-Centric MLLM으로, 의료 분야에서 최고 성능을 보인다.