- #1TSLANet: Rethinking Transformers for Time Series Representation Learning
TSLANet은 시계열 분석을 위한 경량화된 적응형 컨볼루션 네트워크로, Transformer 대비 정확도와 계산 효율성을 동시에 향상시킨다.
- #2RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete
RoboBrain은 ShareRobot 데이터셋을 기반으로, 로봇 조작의 추상적 지시를 구체적 행동으로 변환하는 통합 MLLM 모델로, 기존 모델 대비 14.6~18.75% 성능 향상.
- #3WarpSAC: Towards the Pinnacle of Scalable Off-policy RL by Rethinking Exploration and Exploitation
WarpSAC는 데이터 규모에 따라 안정화 기법을 조정함으로써, 확장 가능한 오프-정책 강화학습의 성능을 4.5%~23.1% 개선하는 알고리즘 패밀리이다.
- #4Large Models for Battery Prognostics and Health Management: A Review and Future Roadmap
대규모 모델(LMs)이 배터리 상태 예측 및 관리(BPHM) 분야에서 기존 한계를 극복할 잠재력을 보여주며, 새로운 연구 방향을 제시한다.
- #5FedCMAPSS: A Benchmark for Federated Learning in Remaining Useful Life Estimation
FedCMAPSS는 연방 학습 기반 RUL 추정 연구를 위한 표준 벤치마크를 제시한다.
- #6Evaluation and Benchmarking of LLM Agents: A Survey
LLM 에이전트 평가의 현황과 주요 과제를 체계적으로 정리한 서베이 논문.
- #7GeoWizard: Unleashing the Diffusion Priors for 3D Geometry Estimation from a Single Image
GeoWizard는 단일 이미지로부터 깊이와 노멀을 추정하는 생성 모델로, 디퓨전 프라이어와 기하학 스위처를 활용해 정밀도와 일반화 능력을 향상시킨다.
- #8LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding
LongVU는 장시간 동영상 이해를 위해 시공간 적응형 압축 기법을 도입한 MLLM 모델로, DINOv2와 텍스트 유도 쿼리를 활용해 토큰 수를 줄이며 정확도를 유지한다.
- #9Large Language Models for Data Annotation and Synthesis: A Survey
GPT-4 기반 대형 언어 모델을 활용한 데이터 어노테이션 및 합성에 대한 체계적 서베이.
- #10PiSSA: Principal Singular Values and Singular Vectors Adaptation of Large Language Models
PiSSA는 LoRA보다 빠르고 성능이 우수한 대형 언어 모델 미세조정 기법으로, 주성분 기반 초기화와 잔여 성분 고정을 통해 70B 모델에서도 86.05% 정확도를 달성한다.
- #11G-Retriever: Retrieval-Augmented Generation for Textual Graph Understanding and Question Answering
G-Retriever는 텍스트 속성 그래프에서 질의 응답을 위한 RAG 기반 프레임워크로, hallucination 저감과 확장성을 실현한다.
- #12ReFT: Reasoning with Reinforced Fine-Tuning
ReFT는 수학 문제 해결을 위한 LLM 학습에서 PPO 기반 강화 학습을 활용해 SFT 대비 75.28%의 정확도를 달성한 새로운 미세조정 방법이다.
- #13Discrete Flow Matching
Discrete Flow Matching은 비자동회귀 방식으로 높은 품질의 이산 데이터를 생성하는 새로운 이산 흐름 모델링 기법이다.
- #246Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization
Zero-WAM은 인-컨텍스트 학습을 기반으로 인간 동영상에서 무작위 작업을 추론해 수행하는 로봇 정책을 제시한다.
- #292PAWBench: How Far Are We from Probabilistically Aligned World Modeling?
PAWBench는 영상 생성 모델이 확률적으로 정렬된 세계 모델링에 얼마나 가까운지를 평가하는 벤치마크로, 50개 시나리오에서 기존 11개 시스템이 모두 일관된 분포를 재현하지 못함을 밝힘.
- #306VGI-BENCH: Probing Visual Intelligence in Video Generation Models
VGI-Bench는 영상 생성 모델의 시각적 추론 능력을 평가하기 위한 새로운 벤치마크로, Seedance 2.0 모델이 51.0% 성능을 기록하는 등 현재 모델들의 한계를 드러낸다.
- #307VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction
VoiceMem은 실시간 음성 대화 시스템에 정보와 감정 메모리를 결합한 스트리밍 듀얼 브레인 메모리 프레임워크이다.
- #308Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling World Models
게임 개발을 기반으로 한 RLHEV 학습 패러다임이 세계 모델 확장에 효과적인 검증 가능한 데이터 엔진으로 제시된다.
- #309JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution
JIT-Agent는 임의의 LLM에 실시간으로 최적화된 agent harness를 생성하여 성능을 대폭 향상시킨다.
- #310StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models
StreamPI는 기존 단일 프레임 VLA 모델에 시간 정보를 추가하면서 추가 파라미터 없이 실시간 추론을 가능하게 하는 스트리밍 멀티모달 시간 모델링 프레임워크이다.
- #311UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City
UrbanGround는 홍콩의 실제 3D 지리 데이터를 기반으로 MLLM 에이전트의 도시 내 지속적 탐색 능력을 평가하는 첫 번째 샌드박스 환경이다.
- #312Procedura: Agentic 3D Modeling with Procedural Control
Procedura는 텍스트 프롬프트를 기반으로 3D 모델을 프로시저적 어셈블리 형태로 생성하는 에이전트 프레임워크로, 정밀한 기하 구조와 편집 가능한 파트 분해를 실현한다.
- #313TTPO: Test-Time Policy Optimization
TTPO는 라벨 없이도 수학적 추론 성능을 향상시키는 테스트 타임 정책 최적화 방법으로, Qwen3-1.7B 모델에서 38.0%에서 45.2%로 정확도를 높인다.
- #314FU-Mamba: A Frequency-Enhanced Dynamic Scanning Framework for Oralscan Image Segmentation
FU-Mamba는 동적 스캐닝과 주파수 영역 강화를 결합한 구강 이미지 세그멘테이션 프레임워크로, mIoU 1.1% 개선을 달성했다.
- #315Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher
Self-OPD는 교사 모델 없이 흐름 일치 모델에 온-폴리시 디스틸레이션을 적용한 새로운 프레임워크로, K개의 SDE 후보 분기와 정규화된 이점을 기반으로 속도장 최적화를 수행한다.
- #316What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents
LLM 에이전트의 생성 데이터를 ACE(정확도-복잡도-다양성) 관점에서 분석하고, (E,q,τ,v) 요소로 분해하여 생성 프레임워크를 제시한다.
- #317MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization
MA-VLA는 다팔 협업을 위한 구조화된 원-모델 VLA 프레임워크로, Arm Shuffle를 통해 새로운 협업 패턴으로의 일반화를 달성한다.
- #318Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report
HAT은 실시간 라이브 스트리밍에 적합한 컴팩트 모델을 Harness 변화에 적응하도록 훈련하는 방법으로, 라이브 QA 정확도 94.8, P50 3.4초 달성.
- #319GameWAM: A World Action Model for Video Games
GameWAM은 비디오 게임에서 시각적 미래와 실행 가능한 키보드-마우스 동작을 병렬 생성하는 최초의 World-Action Model이다.
- #320PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents
PILOT은 실시간 자기 개선을 통해 장기적 작업 성능을 향상시키는 감독자-작업자 구조의 에이전트 허네스이다.