- #1Cura 1T: Specialized Model for Agentic Healthcare
Cura 1T는 의료 분야의 대규모 언어 모델로, 인간 감독 하의 자기 진화 루프를 통해 의료 대화, 진단, EHR 도구 사용 등 복합적인 능력을 개선한 모델이다.
- #3Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories
Xiaomi-Robotics-1은 10만 시간 이상의 실제 조작 데이터로 학습한 VLA 모델로, RoboCasa365에서 57.6% 성공률을 달성했다.
- #4Recursive Harness Self-Improvement
RHI는 사용자 정의 헤이브스를 반복적으로 개선하여 추론 비용을 줄이고 성능을 향상시키는 알고리즘이다.
- #5DSWorld: A Data Science World Model for Efficient Autonomous Agents
DSWorld는 데이터 과학 작업의 효율성을 높이기 위해 작업 흐름의 상태 전이를 예측하는 모델로, RL 기반 학습을 14배, 추론을 3~6배 가속화한다.
- #10RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources
RESOURCE2SKILL은 멀티모달 자료를 실행 가능한 에이전트 스킬로 추출하는 프레임워크로, 7개 도메인에서 평균 +11.9% 성능 향상을 보인다.
- #11RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM
RAGU는 다단계 그래프 기반 RAG 엔진으로, Meno-Lite-0.1이라는 7B 언어 기술 최적화 모델을 통해 그래프 추출 정확도를 12.5% 개선한다.
- #13S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and Generation
S1-Omni는 과학적 이해, 예측, 생성을 위한 통합 멀티모달 추론 모델로, 200개 과학 태스크와 60개 이상의 벤치마크에서 GPT-5.5 및 Gemini-3.1-Pro를 능가한다.
- #15Loop the Loopies!
Loopie는 기존 루프형 트랜스포머의 한계를 극복한 고성능 MoE 모델이다.
- #18xHC: Expanded Hyper-Connections
xHC는 N=4 이상의 잔류 스트림 확장을 효과적이고 계산 효율적으로 만드는 새로운 Hyper-Connections 기법이다.
- #23On-Policy Delta Distillation
On-Policy Delta Distillation(OPD²)은 기존의 on-policy distillation에서 teacher 모델의 output distribution을 모방하는 대신, teacher와 base 모델 간의 delta signal을 활용해 추론 능력을 효과적으로 전달하는 새로운 방법이다.
- #25RecGPT-V3 Technical Report
RecGPT-V3는 Taobao 추천 시스템에서 사용자 이해와 추천 효율성을 동시에 향상시키는 LLM 기반 추천 모델로, Memory Hub, Hybrid-modal Foundation Model, Latent Intent Reasoning를 통해 성능과 자원 소비를 개선한다.
- #26From Human-Centric to Agentic Code Review: The Impact of Different Generations of Generative AI Technology on Review Quality
AI 리뷰 참여가 리뷰 효율성은 향상시키지만 품질 개선으로 이어지지 않음.
- #28Qwen-Music Technical Report
Qwen-Music은 텍스트와 레퍼런스 음악 기반으로 고음질 음악을 생성하는 대규모 음악 생성 모델로, Melody-CoT와 Qwen-Music-Render를 통해 창의성과 음향 품질을 동시에 향상시킨다.
- #29Understanding Reasoning from Pretraining to Post-Training
체스를 사용한 제어된 실험 환경에서 사전학습과 강화학습의 상호작용을 정량적으로 분석하여, 사전학습 데이터량과 모델 규모가 강화학습 성능에 미치는 영향을 규명했다.
- #33When Does Muon Help Agentic Reinforcement Learning?
Muon이 GiGPO 기반의 장기적 희소보상 에이전트 강화학습에서 AdamW 대비 88% 성능 향상을 보인다.
- #34Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel
12B 규모의 언어 모델에 검증된 지식을 바이트 단위로 이식하여 정확도를 80.0%에서 93.3%로 높이고, 추론 비용을 6,574배 절감하는 기술을 제시한다.
- #35Token Time Continuous Diffusion for Language Modeling
TTCD는 토큰별 시간 개념을 도입한 연속 확산 언어 모델로, 빠른 속도에서도 생성 성능을 유지한다.
- #36AsySplat: Efficient Asymmetric 3D Gaussian Splatting for Long-Sequence Scene Modeling
AsySplat은 3D Gaussian Splatting에서 계산 중복을 줄이기 위해 기하학과 외관 모델링을 분리한 비대칭 구조를 제안하여, 800× 가속과 30% 파라미터 감소를 달성한다.
- #38Partition, Prompt, Aggregate: Statistical Self-Consistency in Language Models
LLM이 통계적 자기일관성을 얼마나 잘 따르는지 평가하는 연구.
- #39SeerGuard: A Safety Framework for Mobile GUI Agents via World Model Prediction
SeerGuard는 모바일 GUI 에이전트의 안전성을 향상시키기 위해 실행 전 예측 기반의 지시 및 행동 수준 위험 평가를 결합한 안전 프레임워크이다.
- #40Conditional Reliability of Toxicity Signals for Multilingual and Code-Mixed Abuse Detection
ToxGate는 조건부 신뢰성을 고려한 토스 신호 융합 모듈로, 다국어 및 코드미싱 폭언 탐지 성능을 개선한다.
- #41Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization
CPO는 참조 기반 생성과 일반 생성 간의 토큰 수준 대조 차이를 활용해 RLVR에서 정확성 인식형 advantage shaping을 구현한다.
- #42Rethinking the Evaluation of Harness Evolution for Agents
LLM 에이전트의 하버스 진화 평가 프로토콜을 재검토하고, 기존 평가 방식의 한계를 드러냄.
- #43REBASE: Reference-Background Subspace Elimination for Training-Free In-Context Segmentation
REBASE는 훈련 없이 배경 특성 공간을 제거하여 단일 참조 이미지로 쿼리 이미지의 세그멘테이션 성능을 향상시키는 새로운 인-컨텍스트 세그멘테이션 프레임워크이다.
- #44VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders
VideoRAE는 Video Foundation Models(VFMs)의 냉동 표현을 활용하여 고정밀 비디오 생성을 지원하는 새로운 표현 오토인코더를 제안한다.