- #1Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving
Qwen-Drive-1.0은 사전 학습된 시각-언어 모델에 3D 인식, 운전 질문 답변, 경로 계획을 통합한 자율 주행용 초거대 기초 모델이다.
- #2ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training
ZimaBlue는 대규모 영상 데이터를 활용해 일반화 가능한 월드 액션 모델(WAM)을 학습하는 3단계 훈련 프레임워크로, 120,000시간의 영상 학습으로 로봇 성공률을 36.1%에서 77.8%로 향상시킴.
- #3UI-Venus-2 Technical Report
UI-Venus-2는 모바일, 웹, 데스크톱 환경에서 작동하는 다목적 GUI 에이전트로, 170개 이상의 앱과 강력한 검증 메커니즘을 통해 실용성을 확보한다.
- #4CityGaussian: Real-time High-quality Large-Scale Scene Rendering with Gaussians
CityGaussian(CityGS)는 대규모 3D 장면의 실시간 렌더링을 위해 분할-정복 및 LoD 전략을 도입한 3D Gaussian Splatting 기반 방법이다.
- #5EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time Test
EAGLE-3는 훈련 시 테스트 기법을 도입해 LLM 추론 속도를 최대 6.5배까지 향상시키는 새로운 추론 가속화 방법이다.
- #6Reinforcement Learning for Reasoning in Large Language Models with One Training Example
1-shot RLVR을 통해 단 1개의 예시로 LLM의 수학적 추론 성능을 36.0%에서 73.6%까지 향상시킬 수 있음을 보인다.
- #7MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues
MT-Bench-101은 13개의 다차례 대화 태스크를 기반으로 LLM의 세부 대화 능력을 평가하는 새로운 벤치마크이다.
- #8Mini-Splatting: Representing Scenes with a Constrained Number of Gaussians
Mini-Splatting은 제한된 수의 가우시안으로 장면을 표현하는 문제를 해결하기 위한 밀도 증가 및 단순화 알고리즘을 제안한다.
- #9Debating with More Persuasive LLMs Leads to More Truthful Answers
더 설득력 있는 LLM이 토론을 통해 비전문가가 더 정확한 답을 선택하도록 돕는다.
- #10Chain-of-Thought Reasoning Without Prompting
LLM이 프롬프트 없이 사고 과정을 생성할 수 있음을 보여주는 새로운 디코딩 기법 제시.
- #11DEIM: DETR with Improved Matching for Fast Convergence
DEIM은 DETR 기반 실시간 객체 탐지 모델의 수렴 속도를 빠르게 하기 위해 Dense O2O 매칭과 Matchability-Aware Loss(MAL)를 결합한 훈련 프레임워크이다.
- #12HippoRAG: Neurobiologically Inspired Long-Term Memory for Large Language Models
HippoRAG는 인간의 해마 기반 기억 이론을 모방하여 LLM의 지식 통합을 향상시키는 새로운 RAG 프레임워크로, MuSiQue와 2WikiMultiHopQA에서 최대 20% 개선된 성능을 보인다.
- #13MobileLLM: Optimizing Sub-billion Parameter Language Models for On-Device Use Cases
MobileLLM은 10억 미만 파라미터 모델에서 모델 아키텍처 최적화를 통해 모바일 기기에서의 성능을 획기적으로 향상시킨다.
- #171Safin-1: Safety from Within through Memory-Native State Evolution
Safin-1은 내재적 안전성을 구현하기 위해 메모리 기반 상태 진화와 라우팅을 결합한 기초 모델로, Safety from Within 원칙을 구현한다.
- #291StudentSim: Training LLM-based Student Simulators
StudentSim은 희소한 학습자 데이터를 기반으로 개인화된 학습자 시뮬레이터를 생성하는 프레임워크로, 기존 방법 대비 높은 정확도와 지도 반응성을 보인다.
- #306H3-World: Turning Language Understanding into World Control
H3-World는 MiniMax-H3를 기반으로 언어 인터페이스를 통해 정밀한 월드 컨트롤을 구현하는 효율적인 프레임워크이다.
- #307WebWorld: The Browser as a World Model for Self-Improving Web Code
WebWorld는 브라우저를 월드 모델로 활용해 VLM 기반 웹 코드 자기 개선의 신뢰성을 높이는 인터페이스를 제시한다.
- #308DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution
DreamX-Creator 1.0은 7B 규모의 생성기와 2K 리파이너를 통해 고해상도 동영상과 오디오를 연동 생성하는 오픈 소스 시스템이다.
- #309SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers
SMELT는 계산 예산을 일치시키면서 반복된 중간 레이어를 통해 Transformer 성능을 6.8–18.0% 개선하는 MoE 기반 설계법이다.
- #310IMPACT: Attention Is the Interaction Map for Scalable Interaction-Aware World Model Training
IMPACT는 외부 표현 없이 주의력 기반 상호작용 지도를 통해 세계 모델의 상호작용 생성을 향상시키는 확장 가능한 훈련 프레임워크이다.
- #311Normalized Low-Rank Adaptation
NoRA는 LoRA의 down-projection 행렬을 정규화하여 학습 안정성과 성능을 향상시키는 간단한 방법이다.
- #312Recursive Criticality of AI Self-Improvement
AI 연구 생산성과 피드백 강도를 비교하는 재귀 재생산 수치 $\mathcal{R}_{\mathrm{AI}}$를 도출하여 AI 자기 개선의 자기 증폭 조건을 분석한다.
- #313InternReviewer & InternAdvocate: Objective Reward and Evaluation for Agentic Reinforcement Learning in Peer Review and Rebuttal
InternReviewer와 InternAdvocate는 강화학습 기반의 학술 리뷰 및 반박 생성 에이전트로, 객관적 보상 설계와 실시간 검증을 통해 신뢰성과 정확도를 향상시킨다.
- #314From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix
기업 내 200개 이상의 애플리케이션 트래픽을 단일 모델로 통합하여 GPU 자원을 절약하고 성능을 개선한 내부 LLM 포스트 트레이닝 방법론을 제시한다.
- #315SHAPE of Chain-of-Thought in Math Reasoning
SHAPE는 수학적 추론의 사고 흐름을 해석하기 위한 이론적 프레임워크로, 히ュ리스틱과 의미 공간을 분석하여 LLM의 추론 패턴을 진단하고 정확도를 향상시킨다.
- #316LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation
LightNav-0는 사전 학습된 VLM의 공간 지능을 활용한 일반적 이형 탐색 모델로, 10개 시뮬레이션 환경에서 최고 성능을 보인다.
- #317Super Library Agent: Joint Generation and Maintenance of Multiple Applications Beyond the Single Codebase
Super Library Agent는 다중 애플리케이션 개발 시 공유 로직을 중복하지 않고 유지보수성을 향상시키는 LLM 기반 코드 생성 방법이다.
- #318Evaluating the Hidden Costs of Personalization in Large Language Models
LLM 개인화는 유저 만족도를 높이지만, 무관한 정보 참조, 선호도 축소, 과도한 동의 편향을 유발하며, 이를 평가하기 위한 PRISK 프레임워크를 제안하고 13개 모델에서 평균 45.9% 이상의 편향 증가를 확인했다.
- #319Hi-Q: Hierarchical Evidence-guided Query Refinement for Multi-Hop Question Answering
Hi-Q는 다중 점프 질문 답변에서 증거 기반으로 쿼리 단위의 가독성 여부를 판단하여 계층적 쿼리 정제를 수행하는 새로운 RAG 프레임워크이다.
- #320Chat-Edit-3D++: Interactive 3D and 4D Scene Editing via Large Language Models
CE3D++는 대규모 언어 모델을 기반으로 사용자의 임의 텍스트 입력을 해석해 3D/4D 장면 편집을 가능하게 하는 대화형 편집 프레임워크이다.