- #1Rethinking Cross-Tokenizer On-Policy Distillation: From Alignment Coverage to Supervision Reliability
크로스-토크나이저 온-포로시 디스틸레이션에서 정렬 범위보다 감독 신뢰도가 학습 성능에 더 중요한 역할을 한다는 점을 실증적으로 밝힘.
- #2World Action Learning via Interaction-Centric Spectral Latent Guidance
WING은 인간의 제1인칭 비디오에서 로봇 제어로 상호작용 지식을 전이하는 새로운 프레임워크로, 관찰자 유발 운동을 분리하고 스펙트럼 영역의 저주파 성분을 활용하여 높은 성능을 달성한다.
- #3Red-Teaming LLM Multi-Agent Systems via Communication Attacks
LLM 기반 다중 에이전트 시스템에서 통신 메시지를 조작하는 새로운 공격 방식인 Agent-in-the-Middle(AiTM)를 제안하고, 다양한 환경에서 40% 이상의 공격 성공률을 보인다.
- #4Neutrosophic Ensemble Classification for Uncertainty-Aware Bearing Fault Detection: Evidence from Laboratory and Variable-Speed Industrial Benchmarks
베어링 고장 탐지에서 불확실성 인식을 위한 중성론적 앙상블 분류 방법을 제안하고 실험적으로 검증한다.
- #5MultiChallenge: A Realistic Multi-Turn Conversation Evaluation Benchmark Challenging to Frontier LLMs
MultiChallenge는 최첨단 LLM들이 다중 턴 대화에서 실패하는 4가지 실제적 도전 과제를 평가하는 새로운 벤치마크이다.
- #6WebWalker: Benchmarking LLMs in Web Traversal
WebWalkerQA는 LLM이 웹을 체계적으로 탐색하는 능력을 평가하는 다단계 벤치마크이며, WebWalker라는 탐색-비판 다중 에이전트 프레임워크를 제안한다.
- #7The Illusion of State in State-Space Models
S4, Mamba 등 주요 SSM은 순차적 상태 추적 문제를 해결하지 못하며, 이는 Transformer와 유사한 표현력 한계를 가진다.
- #8FLoRA: Federated Fine-Tuning Large Language Models with Heterogeneous Low-Rank Adaptations
FLoRA는 이질적인 LoRA 어댑터를 지원하는 노이즈 없는 연방 미세조정 알고리즘으로, 기존 FedIT 대비 성능을 개선한다.
- #9SparseTSF: Modeling Long-term Time Series Forecasting with 1k Parameters
SparseTSF는 1,000개 미만의 파라미터로 장기 시계열 예측 성능을 유지하는 초경량 모델이다.
- #10CBraMod: A Criss-Cross Brain Foundation Model for EEG Decoding
CBraMod은 EEG 신호의 구조적 특성을 고려한 크로스-크로스 트랜스포머와 ACPE를 통해 다운스트림 BCI 작업에서 최고 성능을 달성한 EEG 기초 모델이다.
- #11LHRS-Bot: Empowering Remote Sensing with VGI-Enhanced Large Multimodal Language Model
LHRS-Bot은 VGI와 RS 이미지를 기반으로 한 대규모 RS 전용 MLLM으로, LHRS-Align과 LHRS-Instruct 데이터셋을 통해 뛰어난 RS 이미지 이해 능력을 보인다.
- #12MoSca: Dynamic Gaussian Fusion from Casual Videos via 4D Motion Scaffolds
MoSca는 4D 운동 구조를 기반으로 캐주얼 비디오에서 동적 장면을 재구성하고 새로운 뷰를 합성하는 시스템이다.
- #13BiLLM: Pushing the Limit of Post-Training Quantization for LLMs
BiLLM은 1.08-bit 평균 가중치로 LLaMA2-70B 모델에서 8.41의 퍼플렉시티를 달성한 1-bit 후학습 양자화 기법이다.
- #284Event Cameras for Melt-Pool Monitoring in Additive Manufacturing: A Benchmark and a Cross-Machine Transfer Analysis
- #285Anchor and Adapt: Asymmetric Prompt Adaptation for Few-Shot Industrial Anomaly Detection
- #306AdvSim2Real : Training Web Agents Against Adaptive Prompt Injection in a Web World Model
AdvSim2Real은 웹 에이전트의 안정성과 능력을 동시에 향상시키기 위해 웹 월드 모델 내에서 커리큘럼, 에이전트, 적대자 정책을 공진화시키는 시뮬레이션 기반 훈련 방법이다.
- #307AGO AI Quality Gate: Evidence-First Release Decisions for Retrieval-Augmented Generation
AGO AI Quality Gate는 RAG 시스템의 출시 결정을 위한 증거 중심 품질 게이트 프레임워크로, 판단자(LLM)의 신뢰도와 통계적 불확실성을 명시적으로 고려한다.
- #308DistScene: Object-to-Scene Distillation for 3D Scene Generation
- #309Adaptive Latent Capacity for World Models
ALeWM은 JEPA 기반 월드 모델에서 예측 정보를 짧은 접두사에 집중시키는 Adaptive Latent Capacity 기법을 제안한다.
- #310TRACE: Rollout-Guided Quantization-Aware Training for FP4 Reinforcement Learning of MoE Language Models
TRACE는 MoE 언어 모델의 FP4 강화학습에서 훈련-롤아웃 불일치를 줄이는 rollout-guided QAT와 효율적인 정보 캐싱을 결합한 양자화 프레임워크이다.
- #311CheckerBench: Can Long-Horizon Agents Synthesize Static-Analysis Checkers?
CheckerBench는 코드 생성 에이전트가 정적 분석 체커를 독자적으로 개발하는 능력을 평가하는 실행 가능한 벤치마크로, 300개의 실제 취약점 기반 작업을 포함한다.
- #312From Evidence to Action: How Tool-Using Agents Fail
- #313Towards In-Parameter Memory Augmentation for Large Language Models
LLM에 사전 학습 이후 지식을 효율적으로 통합하기 위한 in-parameter memory augmentation 방법론을 두 축으로 분류하고 정리한다.
- #314Taming VLAs under Robot Execution Errors: Self-Compensation and Stress Testing
로봇 실행 오류에 대응하는 VLA 정책의 실시간 적응 방법과 시뮬레이션 벤치마크를 제안한다.
- #315HuatuoGPT-3: RL-Only Domain Adaptation from Base Models
HuatuoGPT-3는 RL-Only 기반 도메인 적응 프레임워크인 OnePO를 통해 20K 샘플로 67.2의 HealthBench 점수를 달성한 의료 전문 LLM 시리즈다.
- #316UNREAL: Unifying Retrieval and Long-Context with a Single Model
- #317MiniCorp: The Last Mile of the AI Agent Firm
- #318DiffGate: Difficulty-Gated Teacher Guidance for On-Policy Distillation
DiffGate는 GRPO와 선택적, 제한된 교사 지도를 결합한 새로운 온-포리시 디스틸레이션 방법으로, 실패한 추적에만 교사 신호를 적용하여 성능을 향상시킨다.
- #319GUI-HARVEST: Self-Improving GUI Agents through Evidence-Driven Harness Evolution
GUI-HARVEST는 GUI 모델의 실행 환경을 자동 최적화하여 동결된 백본 모델 기반의 자가 개선 GUI 에이전트를 구현하는 시스템이다.
- #320Execution-Aligned Progressive Noise for Consistent Asynchronous Replanning in Generative Robot Policies
EAPN은 비동기 재계획에서 일관성을 유지하기 위해 실행 경로와 정렬된 노이즈를 도입한 로봇 정책 기법이다.