- #1Uncertainty Quantification and Confidence Calibration in Large Language Models: A Survey
LLM에서 불확실성 양화(UQ)의 중요성과 기존 방법의 한계를 분석하고, 새로운 분류체계를 제시한 조사 논문.
- #2PhyScene: Physically Interactable 3D Scene Synthesis for Embodied AI
PhyScene은 물리적 상호작용을 고려한 3D 장면 생성을 위한 조건부 확산 모델 기반의 새로운 방법이다.
- #3A Vehicle-Integrated Approach to Digital Twin Deployment for Bridges Through Drive-By Sensing
- #4The pitfalls of next-token prediction
Next-token prediction이 인간 지능을 충분히 모델링하지 못할 수 있음을 밝히고, teacher-forcing의 한계를 실증적으로 분석한다.
- #5Flow Q-Learning
Flow Q-Learning(FQL)은 복잡한 행동 분포를 모델링하는 flow policy를 활용한 오프라인 강화학습 방법으로, 73개의 OGBench 및 D4RL 태스크에서 우수한 성능을 보인다.
- #6Agent-as-a-Judge: Evaluate Agents with Agents
Agent-as-a-Judge를 제안하며, DevAI 벤치마크에서 90%의 인간 평가자와 일치율을 보임.
- #7Multi-agent Architecture Search via Agentic Supernet
MaAS는 다중 에이전트 시스템의 자동 설계를 위한 확률적 아키텍처 분포인 agentic supernet을 최적화하여, 다양한 쿼리에 맞춤형으로 자원을 할당하고 성능을 향상시킨다.
- #8Spike-driven Transformer V2: Meta Spiking Neural Network Architecture Inspiring the Design of Next-generation Neuromorphic Chips
Meta-SpikeFormer는 ImageNet-1K에서 80.0% 정확도를 달성한 첫 Transformer 기반 SNN이며, CNN 기반 SNN 대비 3.7% 개선된 성능을 보인다.
- #9HUGS: Holistic Urban 3D Scene Understanding via Gaussian Splatting
HUGS는 3D 가우시안 스플래팅을 활용해 도시 장면의 기하, 외관, 의미, 운동을 통합 최적화하는 실시간 렌더링 파이프라인을 제안한다.
- #10FinBen: A Holistic Financial Benchmark for Large Language Models
FinBen은 금융 분야 대형 언어 모델 평가를 위한 최초의 종합적 오픈소스 벤치마크로, 24개 금융 태스크와 36개 데이터셋을 포함한다.
- #11InfLLM: Training-Free Long-Context Extrapolation for LLMs with an Efficient Context Memory
InfLLM은 추가 학습 없이 기존 LLM이 긴 시퀀스를 처리할 수 있도록 돕는 메모리 기반의 훈련 없는 방법이다.
- #38Long-WAM: Scaling the Context of World-Action Models
- #303WorldSonus: Bringing Sound to Worlds
- #304RobotWorld: Benchmarking Multimodal Agents for Robot Use Across Diverse Tasks and Embodiments
- #305Rethinking World-Action Model for Compositional and In-Context Robotic Manipulation
- #306PhysEvo: Astra Can Act, Let It
- #307STEPQuant: When and Where Errors Matter in Delta-Rule Recurrent State Quantization
- #308Recursive Game Creator: An Agentic Product-Level Experience-Oriented Game Harness
- #309DecepEval: A Benchmark for Evaluating Deception in LLM Agents
DecepEval은 LLM 에이전트의 사기성 행동을 평가하기 위한 벤치마크로, 3가지 작업군과 28개 전문 시나리오에서 1,532개 인스턴스를 포함한다.
- #310GRACE: Generation-aware latent compression for efficient video generation
- #311A self-learning scientific agent for X-ray diffraction
- #312PanoPed: Beyond Bounding Boxes for Sim-to-Real Panoramic Pedestrian Tracking
- #313VepAgent: Bridging Causal-Transition via Tool-Augmented Reinforcement Learning for Video Event Prediction
- #314SGF+: Decoupling Gradient Flows for Autoregressive Video Generation
- #315UniWAM: Unified World-Action Model
UniWAM은 언어-비주얼-액션 통합 학습을 통해 물리적 세계 이해, 시각 생성, 액션 예측을 동시에 수행하는 새로운 통합 아키텍처이다.
- #316UltraText Bench: A Comprehensive Bilingual Benchmark for Evaluating Visual Text Rendering in Image Generation
- #317Semifactual Credit-Augmented Policy Optimization
- #318Tetris3D: 3D Scene Generation With Objects That Fit Together
- #319RunningTab: Direct Workspace Interaction with Environment-Side Tabs
- #320Gains and Collapse in On-Policy Distillation:A Reinforcement Learning Perspective