- #1LLM Evaluators Recognize and Favor Their Own Generations
GPT-4와 Llama 2는 자체 생성 텍스트를 인식하는 능력이 있으며, 이는 자가 평가 시 자기 편향(self-preference)을 유발한다.
- #2Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models
Self-Play fIne-tuNing(SPIN)은 추가 인공 데이터 없이 약한 언어 모델을 강력한 모델로 전환하는 새로운 미세조정 방법이다.
- #3BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions
BigCodeBench는 1,140개의 실용적 프로그래밍 태스크로 LLM의 다중 함수 호출 및 복잡한 지시사항 처리 능력을 평가하는 새로운 벤치마크이다.
- #4FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision
FlashAttention-3는 Hopper GPU에서 1.5~2.0× 가속과 75% 활용률 달성한 최적화된 어텐션 알고리즘.
- #5KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization
KVQuant은 3비트 정밀도로 0.1 perplexity 이하의 정확도 손실을 유지하면서 1000만 토큰 길이의 LLM 추론을 가능하게 하는 KV 캐시 양자화 기법이다.
- #6Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion
Diffusion Forcing는 인과적 구조를 갖춘 확률적 시퀀스 모델로, 다양한 길이의 시퀀스 생성과 장기적 가이드라인 적용을 동시에 가능하게 한다.
- #7GPT-4V(ision) is a Generalist Web Agent, if Grounded
GPT-4V를 기반으로 한 웹 에이전트 SeeAct는 50%의 실시간 웹사이트 작업 성공률을 기록했으나, 정확한 시각적 접지(grounding)는 여전히 주요 과제이다.
- #8RAPTOR: Recursive Abstractive Processing for Tree-Organized Retrieval
RAPTOR은 재귀적 요약을 통해 문서의 다층적 맥락을 효과적으로 검색하는 트리 기반 검색 시스템이다.
- #9Simplified and Generalized Masked Diffusion for Discrete Data
이 연구는 마스킹 확산 모델을 단순화하고 일반화하여 이산 데이터 생성 성능을 크게 향상시킨다.
- #10QuaRot: Outlier-Free 4-Bit Inference in Rotated LLMs
QuaRot는 4비트 정밀도로 LLM을 end-to-end로 양자화하는 새로운 기법으로, 모든 가중치, 활성화, KV 캐시를 4비트로 처리하면서 정확도 손실을 최소화한다.
- #301BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation
BridgeVLA++는 3D 로봇 조작에서 데이터 효율성과 기억 기반 추론을 동시에 달성한 통합 Vision-Language-Action(VLA) 프레임워크이다.
- #302Poly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow Models
Poly-OPD는 서로 다른 텍스트-이미지 생성 모델의 강점을 하나의 학생 모델로 통합하는 이질적 온-포로시 디스틸레이션 프레임워크이다.
- #303Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data
Ego2Robot은 인간 제1인칭 조작 영상에서 로봇 학습 데이터를 대규모로 생성하는 파이프라인으로, 18,561시간의 데이터를 생성해 일반화 성능을 향상시킨다.
- #304MiniWorld: Democratizing the Training of Video World Models from Scratch
MiniWorld는 8-GPU 서버에서 단기간에 훈련 가능한, 스트리밍 비디오 월드 모델의 재현 가능한 기반 프레임워크이다.
- #305HelloWorld: Enabling Socially Interactive Characters in Video World Models
HelloWorld는 사용자와 영상 내 캐릭터 간 사회적 상호작용을 가능하게 하는 비디오 월드 모델로, 자체 학습 파이프라인과 추론 시 교차-주의 마스크를 제안한다.
- #306ARCHead: Activation-Metric Residual Correction for Large Language Model Output Heads
ARCHead는 LLM의 출력 헤드를 압축하는 기술로, BF16 저장 공간을 3.7–3.9배 줄이며 1.007의 상대 퍼플렉시티를 달성한다.
- #307Are the Financial Reasoning from LLMs Credible? A Real World Test over Long-Horizon Statements
LLM이 금융 분석에서 진정한 구조적 추론을 수행하는지, FinIndices 벤치마크를 통해 실질적인 테스트를 진행한 연구.
- #308Robust and Personalized Federated Learning for Aircraft-Engine Prognostics under Benign and Adversarial Client Heterogeneity
비양심적 클라이언트와 이질적 데이터 환경에서 항공기 엔진 예측 유지보수를 위한 강건하고 개인화된 연방 학습 방법을 제안한다.
- #309ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment
ABSeeker는 정답 추적을 기반으로 한 세부 단계 보상 할당을 통해 4B 규모 모델로도 30B 규모 대형 에이전트와 유사한 성능을 달성한 장기 탐색 에이전트이다.
- #310ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation
ToolArtist는 완전한 에이전트 정책을 통해 외부 도구 사용과 이미지 생성을 통합한 통합 멀티모달 모델이다.
- #311Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent
Video-DeepResearch는 비디오 기반 멀티모달 에이전트의 새로운 훈련-평가 프레임워크로, 64.0% 정확도를 달성하며 기존 모델을 상회한다.
- #312Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes
본 연구는 멀티모달 사전 학습의 핵심 메커니즘을 실증적으로 탐구하여, 지식 흐름, 모달리티 시너지, 조기 통합, 효율적 학습 레시피를 제시한다.
- #313The Personalization Mirage: How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads
개인화된 대형 언어 모델(LLM)이 사용자 정보를 과도하게 추론하는 문제를 분석하고, 자기 평가가 신뢰도를 왜곡하는 현상을 밝혀낸 연구.
- #314OneDayAgent: Towards a Long-Horizon Harness for Autonomous Agents
OneDayAgent는 GLM-5.2 백엔드에서 AgentIF-OneDay 데이터셋에서 0.821의 최고 성능을 달성한 장기적 자율 에이전트 허네스이다.
- #315LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models
LLaDA MoE v2는 23.5T 토큰으로 학습된 30B-A3B 확산 언어 모델로, Qwen3와 유사한 성능을 65% 적은 토큰으로 달성한다.
- #316Self-Evolving Coding Agents
자체적으로 학습하고 진화하는 코드 에이전트에 대한 체계적인 분석과 분류를 제시한 서베이 논문.
- #317GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks
GDPevo는 기업 업무 흐름 기반의 자동화된 에이전트 자기 진화 평가 벤치마크로, 훈련 경험을 기반으로 테스트 성능 향상을 정량적으로 측정한다.
- #318Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning
Skill Entropy와 Skill²-Bench를 제안하여 LLM의 장기적 추론 능력 평가 및 훈련을 개선한다.
- #319When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation
SA-OPD는 입력에 약하게 의존하면서도 강한 영향을 미치는 가짜 신호를 필터링하여 온-정책 디스틸레이션의 안정성과 효과성을 향상시킨다.
- #320SIGNPOST-Bench: Benchmarking Text-Vision Conflict Resolution in Multimodal Large Language Models
SIGNPOST-Bench는 텍스트-비전 충돌 해결 능력을 평가하는 5가지 조건의 대규모 벤치마크로, 20개 MLLM 모델을 평가하여 평균 위치 오차를 4.8배 증가시키는 텍스트 영향을 밝혀냈다.