- #1RoboDreamer: Learning Compositional World Models for Robot Imagination
RoboDreamer는 언어 조건을 구성 요소로 분해하여 비전-언어 세계 모델을 학습하여 로봇의 제어 계획을 개선하는 새로운 접근법이다.
- #2APIGen: Automated Pipeline for Generating Verifiable and Diverse Function-Calling Datasets
APIGen은 검증된 60,000개의 함수 호출 데이터셋을 생성하는 자동화된 파이프라인으로, 7B 파라미터 모델이 GPT-4를 능가하는 성능을 보인다.
- #3O1-Pruner: Length-Harmonizing Fine-Tuning for O1-Like Reasoning Pruning
O1-Pruner는 수학적 추론 과제에서 정확도를 유지하면서 추론 길이를 줄이는 긍정적 결과를 보이는 길이 조화 최적화 프레임워크이다.
- #4Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study
PPO는 DPO보다 대규모 언어 모델 정렬에서 더 우수한 성능을 보인다.
- #5LLMs instead of Human Judges? A Large Scale Empirical Study across 20 NLP Evaluation Tasks
LLM을 인간 평가자 대체로 사용할 수 있는지 20개 NLP 평가 태스크에서 대규모 실험을 통해 검증한 연구.
- #6Guiding a Diffusion Model with a Bad Version of Itself
이미지 생성 확산 모델에서 생성 품질을 향상시키며 변이성을 유지하는 새로운 자가가이드(autoguidance) 방법을 제안한다.
- #7RankRAG: Unifying Context Ranking with Retrieval-Augmented Generation in LLMs
RankRAG는 단일 LLM을 사용해 컨텍스트 랭킹과 답변 생성을 동시에 학습하여 기존 RAG 파이프라인의 성능을 크게 개선한다.
- #8AFlow: Automating Agentic Workflow Generation
AFlow는 Monte Carlo Tree Search를 활용해 LLM 기반 작업 흐름을 자동 생성하고 최적화하는 프레임워크로, 기존 방법 대비 5.7% 성능 향상과 4.55%의 저비용으로 GPT-4o를 초과한다.
- #9When Scaling Meets LLM Finetuning: The Effect of Data, Model and Finetuning Method
LLM 미세조정에서 데이터, 모델, 조정 방법의 스케일링 효과를 실증적으로 분석한 연구.
- #10Two Tales of Persona in LLMs: A Survey of Role-Playing and Personalization
LLMs에서 사용자 또는 모델에 인물(persona)을 할당하는 두 가지 접근 방식을 체계적으로 분류한 최초의 서베이 논문.
- #281Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement
On-Policy Self-Adaptation(OPSA)는 교사 모델 없이 토큰별 엔트로피에 기반한 음의 보상을 통해 학습 성능을 263% 향상시킨다.
- #292Lucida: Parse, Generate, and Place for Composable Real-to-Sim Scene Modeling
Lucida는 실내 장면을 개별적으로 편집 가능한 3D 자산으로 변환하는 파이프라인으로, 기존 방법 대비 정확도를 크게 향상시킨다.
- #303WebWorld: The Browser as a World Model for Self-Improving Web Code
WebWorld는 브라우저를 월드 모델로 활용해 VLM 기반 웹 코드 자기 개선의 신뢰성을 높이는 인터페이스를 제시한다.
- #304CogEvol: Towards Efficient and Reliable Learning Environment Generation
CogEvol은 교육 환경 생성을 위한 단일 패스 모델로, 220k 요청에서 슬라이드 생성 시간을 17초로 단축하고 신뢰성을 강화한 RL 기반 시스템이다.
- #305LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering
LoopArena는 코드 작성 에이전트를 장기 과제에서 효과적으로 제어하는 모델의 능력을 평가하는 벤치마크이다.
- #306DART-SD: Diamond-topology Aware Retrieval and Tuning for Self-Distillation of Multi-Turn Tool-Calling Agents
DART-SD는 다중 턴 툴 호출 에이전트의 자기 교사 학습을 위해 다이아몬드 토폴로지를 고려한 새로운 프레임워크로, 정확도와 정책 다양성을 동시에 향상시킨다.
- #307DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution
DreamX-Creator 1.0은 7B 규모의 생성기와 2K 리파이너를 통해 고해상도 동영상과 오디오를 연동 생성하는 오픈 소스 시스템이다.
- #308GenFirst: Generation Before Reconstruction for Stable End-to-End Latent Generative Modeling
GenFirst는 생성-재구성 간 충돌을 해결해 안정적인 엔드투엔드 레이턴트 생성 모델링을 제시한다.
- #309Agentic Artifact Creation: Systems, Evaluation, Principles, and Opportunities
지능형 에이전트가 생성물을 상태를 유지하면서 구축하고 수정하는 과정을 체계적으로 분석한 조사 연구.
- #310CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents
CAST는 장기적 툴 호출 작업에서 신뢰성을 향상시키기 위한 비판 인식 훈련 프레임워크로, Qwen3 모델에서 Retail과 Telehealth에서 각각 10%와 9% 개선을 달성했다.
- #311Normalized Low-Rank Adaptation
NoRA는 LoRA의 down-projection 행렬을 정규화하여 학습 안정성과 성능을 향상시키는 간단한 방법이다.
- #312PaperGym: Rubric-Centered Evolution for Research-Plan Generation
PaperGym은 연구 계획 생성을 위한 강화 학습 환경으로, 논문 구조를 활용해 기존보다 훨씬 낮은 기준 누수율(3.7%)과 높은 성능(73.48, ResearchQA)을 달성한다.
- #313On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability
Qwen3.8-Flash-Next는 125B 파라미터를 가진 스파스 믹스-오브-익스퍼트 모델로, 효율성과 훈련 안정성을 동시에 향상시킨다.
- #314Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models
INDI는 VLA 모델의 액션 디코더에 행동 수준의 의도를 증류하여 성능과 일반화 능력을 향상시킨다.
- #315LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation
LightNav-0는 사전 학습된 VLM의 공간 지능을 활용한 일반적 이형 탐색 모델로, 10개 시뮬레이션 환경에서 최고 성능을 보인다.
- #316SHAPE of Chain-of-Thought in Math Reasoning
SHAPE는 수학적 추론의 사고 흐름을 해석하기 위한 이론적 프레임워크로, 히ュ리스틱과 의미 공간을 분석하여 LLM의 추론 패턴을 진단하고 정확도를 향상시킨다.
- #317Super Library Agent: Joint Generation and Maintenance of Multiple Applications Beyond the Single Codebase
Super Library Agent는 다중 애플리케이션 개발 시 공유 로직을 중복하지 않고 유지보수성을 향상시키는 LLM 기반 코드 생성 방법이다.
- #318Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence
대규모 추론 모델(LRMs)이 인간 감독 없이도 학습을 지속하는 방식을 구조화하고, 그 과정에서 발생하는 위험과 평가 체계를 제시한다.
- #319Evaluating the Hidden Costs of Personalization in Large Language Models
LLM 개인화는 유저 만족도를 높이지만, 무관한 정보 참조, 선호도 축소, 과도한 동의 편향을 유발하며, 이를 평가하기 위한 PRISK 프레임워크를 제안하고 13개 모델에서 평균 45.9% 이상의 편향 증가를 확인했다.
- #320Locate Anything in Videos: Rethinking Efficient Generative Spatio-Temporal Video Grounding
Parallel Tube Decoding(PTD)를 제안하여 영상 내 시공간 객체 추적의 효율성과 정확도를 동시에 향상시킨다.