- #2Benchmarking LLMs via Uncertainty Quantification
LLM 평가에 불확실성 측정을 통합한 새로운 벤치마킹 방법을 제안하며, 9개 모델을 5개 NLP 태스크에서 평가한 결과를 제시한다.
- #3Predictive Inverse Dynamics Models are Scalable Learners for Robotic Manipulation
Seer는 시각-작업 루프를 통합한 예측적 역 역학 모델(PIDM)로, 대규모 데이터 학습을 통해 시뮬레이션 및 실제 환경에서 기존 방법 대비 13~43% 성능 향상.
- #6A Roadmap to Pluralistic Alignment
AI 시스템이 다양한 인간 가치를 반영하도록 정렬하는 "플러럴리즘 정렬"을 위한 구체적 로드맵을 제안한다.
- #7Imagine while Reasoning in Space: Multimodal Visualization-of-Thought
MVoT는 시각적 추론을 통해 MLLM의 공간적 추론 능력을 향상시키는 새로운 추론 패러다임이다.
- #8LLaGA: Large Language and Graph Assistant
LLaGA는 그래프 구조 데이터를 LLM과 호환 가능한 토큰 임베딩 공간으로 매핑하여 다양한 그래프 작업에서 뛰어난 성능을 보이는 통합 모델이다.
- #9Don't Hallucinate, Abstain: Identifying LLM Knowledge Gaps via Multi-LLM Collaboration
다중 LLM 협력 기반 Cooperte 및 Compete 메커니즘을 통해 LLM 지식 공백을 최대 19.3% 개선된 정확도로 식별하고 답변을 회피한다.
- #10Mobile-Agent-v2: Mobile Device Operation Assistant with Effective Navigation via Multi-Agent Collaboration
Mobile-Agent-v2는 다중 에이전트 협업을 통해 모바일 기기 작업을 효율적으로 수행하는 시스템으로, 단일 에이전트 대비 30% 이상의 작업 완료율 향상을 보인다.
- #11Retrieval Head Mechanistically Explains Long-Context Factuality
LLaMA-2 7B 등 다양한 모델에서 정보 검색을 담당하는 'retrieval head'가 존재하며, 이는 hallucination과 추론 성능에 직접적인 영향을 미친다.
- #12Aya Dataset: An Open-Access Collection for Multilingual Instruction Tuning
Aya Dataset은 65개 언어의 20만 개 이상의 인간 주도 인스트럭션-완료 쌍을 포함한 최대 규모의 오픈소스 다국어 학습 데이터셋이다.
- #13MetaMorph: Multimodal Understanding and Generation via Instruction Tuning
MetaMorph는 VPiT를 통해 텍스트와 시각 토큰을 생성하는 통합 모델로, 시각 이해와 생성 모두에서 경쟁력 있는 성능을 보인다.
- #307Don't Mask the Environment: Observation Supervision Changes How Agents Explore Under RL
ActObs는 환경 관측값을 예측 대상으로 포함시켜 강화학습 초기화를 개선하여 GRPO 후 탐색 성능을 향상시킨다.
- #308VākQA: A Benchmark and Evaluation Study for Telugu Spoken Factoid Question Answering
텔루구어 음성 기반 팩트오이드 QA 벤치마크 VākQA를 제안하고, 평가 방법과 모델 성능을 분석한다.
- #310Can MiniMax-H3 Reason About the Physical World? An Evaluation of Omni-Modal Generative Model
MiniMax-H3의 물리적 세계 추론 능력을 다중 모달 입력 기반 평가 프레임워크로 평가한 연구.
- #311When EOS Tokens Disagree: Understanding Length Inflation in On-Policy Distillation
OPD에서 길이 과장 문제를 유발하는 EOS 토큰 불일치를 분석하고, 이를 해결하기 위한 종단 동작 정렬 전략을 제안한다.
- #317JEPA-Anything: Learning Predictive Models across Different Worlds
JEPA-Anything는 다양한 도메인에서 예측 모델링을 가능하게 하는 통합 프레임워크로, 정교한 인자 분해와 재사용 가능한 예측 구조를 통해 성능을 향상시킨다.
- #321Verifiable Social Reasoning for LLM Assistants
LLM 어시스턴트의 일상적 사회적 추론 능력을 평가하기 위한 새로운 시뮬레이션 프레임워크 Fuse를 제안하고, 12개 모델을 분석하여 사용자 매개 변수의 영향을 밝혀냈다.
- #323Self-Evolving Search Index
SELF-INDEX는 인덱스 키를 자동 진단·수정·검증하는 프레임워크로, 다양한 검색 환경에서 검색 성능을 지속적으로 향상시킨다.
- #324RiskChainBench: A Benchmark for Obfuscated Platform Message Restoration and Evidence-Grounded Web Investigation
RiskChainBench는 위장된 메시지 복원과 증거 기반 웹 조사의 연계성을 평가하는 새로운 벤치마크로, 3,600개의 토큰-텍스트 입력과 600개의 로컬 웹 환경을 제공한다.
- #325RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning
RetireOPD는 강화학습 기반 에이전트에 기술 정보를 내재화하는 자가 퇴역형 온-폴리시 디스틸레이션 방법으로, ALFWorld와 WebShop에서 성능을 11.8%~18.8% 개선한다.
- #327Reflect, Revise, Reuse: Training-Free Skill Evolution for GUI Agents
EvoSkill-GUI는 GUI 에이전트의 실행 피드백을 기반으로 훈련 없이 스킬을 수정하는 반복 루프를 통해 성능을 향상시킨다.
- #328WeVisDoc: From Coverage to Capability for Robust End-to-End Document Parsing
WeVisDoc은 두 단계의 데이터 중심 프레임워크로, 다양한 문서 파싱 성능을 95.38 (OmniDocBench v1.6)까지 향상시킨다.
- #329Video DeltaNet: A Video-Native Hybrid Attention for Livestream Video Generation
Video DeltaNet(VDN)은 영상 생성 속도를 14.5× 향상시키는 하이브리드 어텐션 구조를 제안한다.
- #331VABench: Measuring Embodied Spatial Intelligence through Visual Demonstrations, Active Perception, and Metric Control
VABench는 시각 시연, 능동적 관찰, 메트릭 제어를 통해 MLLM의 공간 지능을 종합적으로 평가하는 벤치마크이다.
- #332When2Think: Learning Difficulty-Aware Length Control for Efficient Hybrid Reasoning Models
When2Think는 문제 난이도에 따라 추론 깊이를 조절하여 효율적인 하이브리드 추론을 학습하는 포스트-트레이닝 프레임워크이다.
- #333What Does Privileged Information Add to On-Policy Self-Distillation?
On-policy self-distillation에서 privileged information의 추가 가치를 AMPLE-Math 데이터셋을 통해 분리 평가한 연구.
- #334UFO: Chain-of-Evaluation for Omni-Condition Alignment in Multi-Modal Image Generation
UFO는 다중 조건 일치 평가를 위한 체인형 평가 프레임워크로, 기존 방법 대비 15.25% 높은 인간 평가와의 상관성을 달성했다.
- #335Sample Count Is Not Enough: Candidate-Generation Strategy Shapes the Energy and Performance of LLM Test-Time Scaling
테스트 타임 스케일링에서 후보 생성 방식이 성능과 에너지 소비에 큰 영향을 미친다.
- #336FAMOS: Feed-Forward 3D Articulation Modeling from Sparse Observations
FAMOS는 희소한 단일 뷰에서 3D 조인트 모델링을 수행하는 피드포워드 모델로, Multi-state Articulation Transformer와 observed articulation span loss를 통해 정확도를 향상시킨다.
- #337Region-Level Policy Optimization for Fine-grained MLLM Perception
Vision-RL2는 MLLM에서 지역 수준 강화 학습을 통해 시각 토큰 수를 4배 줄이며 정확도를 향상시키는 지역 선택 최적화 방법이다.
- #338Srijika: OpenType-Layout-Reusing Font Restyling for Nine Indic Scripts
Srijika는 9개의 브라흐미 글꼴 스크립트에 대한 OpenType 레이아웃 재사용 기반 글꼴 리스타일링 시스템이다.