- #1In-Context Robot Learning with VLM Agents
GPT-Policy는 VLM을 활용한 실시간 컨텍스트 학습을 통해 로봇 행동을 생성하고 검증하는 새로운 로봇 학습 프레임워크이다.
- #2Identity-Preserving Text-To-Video Generation by Frequency Decomposition
ConsisID는 주어진 텍스트에 따라 생성된 동영상에서 인물의 정체성을 유지하는 데, 주파수 분해를 기반으로 하는 DiT 기반 컨트롤 방식을 제안한다.
- #3Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning
VPL(Variational Preference Learning)을 통해 개인별 선호를 반영한 다중 모달 RLHF를 구현하고, 다양한 사용자 집단의 정확한 보상 모델링을 실현한다.
- #4DUET: Dual Clustering Enhanced Multivariate Time Series Forecasting
DUET는 시간과 채널 차원의 이중 클러스터링을 통해 다변량 시계열 예측 성능을 향상시키는 새로운 프레임워크이다.
- #5SpectralShift: Effective Context Window Extension of Gated DeltaNet via Spectral Reparameterization
SpectralShift는 Gated DeltaNet의 컨텍스트 확장을 위해 스펙트럼 재매개변수화를 통해 장거리 정보 전달 능력을 향상시키는 방법이다.
- #6MegaSaM: Accurate, Fast, and Robust Structure and Motion from Casual Dynamic Videos
MegaSaM은 동적 장면의 비구조화 단일 카메라 영상에서 정확하고 빠르게 카메라 파라미터와 깊이 맵을 추정하는 시스템이다.
- #7ShowUI: One Vision-Language-Action Model for GUI Visual Agent
ShowUI는 UI-가이드 토큰 선택, 인터리브 스트리밍, 고품질 데이터셋을 결합한 2B 파라미터 GUI 시각 에이전트 모델로, 75.1%의 제로샷 정확도를 달성한다.
- #8Pathformer: Multi-scale Transformers with Adaptive Pathways for Time Series Forecasting
Pathformer는 다양한 시간 스케일의 시계열 패턴을 적응적으로 모델링하는 다중 스케일 트랜스포머 모델로, 11개 실제 데이터셋에서 기존 모델을 초과하는 성능을 보인다.
- #9HelpSteer2: Open-source dataset for training top-performing reward models
HelpSteer2는 10,000개의 응답 쌍으로 구성된 오픈소스 퍼포먼스 데이터셋으로, SteerLM 2.0과 함께 사용 시 Reward-Bench에서 92.0%의 최고 성능을 달성한다.
- #10SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal Behaviors
SORRY-Bench는 LLM의 안전 거부 능력을 체계적으로 평가하기 위한 새로운 벤치마크로, 44개 주제, 8.8K 개의 언어 변형, 7K+ 인간 라벨을 기반으로 설계되었다.
- #11VideoLLM-online: Online Video Large Language Model for Streaming Video
VideoLLM-online은 실시간 동영상 스트리밍 대화를 지원하는 LIVE 프레임워크를 기반으로 구축된 모델로, 10 FPS 이상의 처리 속도와 뛰어난 오프라인 벤치마크 성능을 보인다.
- #12RedPajama: an Open Dataset for Training Large Language Models
RedPajama는 100조 토큰 이상의 오픈 소스 대형 언어 모델 학습 데이터셋으로, 투명성과 품질 신호를 통해 모델 성능을 개선한다.
- #303Zing-0.5: Toward Playable Worlds with Real-Time Joint Action and Text Control
Zing-0.5는 실시간 키보드와 텍스트 제어를 결합한 5B 규모의 생성 세계 모델로, WBench Navigation에서 81.0의 종합 점수를 달성했다.
- #304LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence
LimiX-2는 Contextual Mechanism Networks(CMNs)를 기반으로, CCMM을 통해 학습된 다목적 테이블 데이터 지능 모델로, TabArena, TALENT, BCCO에서 기존 모델을 상회하며 인과성도 반영한다.
- #305ScienceIDE: Turning World's Scientific Codebase into Agent Learnable Environments
ScienceIDE는 과학 코드베이스를 학습 가능한 환경으로 전환하여 과학적 경험을 기반으로 AI 에이전트를 훈련하는 인프라를 제시한다.
- #306PACT: Can Enterprise AI Assistants Be Trusted Under Pressure?
PACT는 기업 AI 어시스턴트의 규정 준수를 압박 상황에서 평가하는 벤치마크로, 22개 모델의 6~10% 규칙 위반과 65% 평균 위반 증가를 보여준다.
- #307ActionPiece: Rethinking Action Tokenization for Autoregressive Vision-Language-Action Models
ActionPiece는 물리적 관계를 고려한 액션 토크나이저로, VLA 모델에서 정확한 제어를 위해 PRC와 QR을 결합한 학습 방식을 제안한다.
- #308Fingers as Legs: Learning Self-Supported Locomotion and Manipulation with an Anthropomorphic Hand
인간 손 형태의 로봇이 위치 제어기를 유지하면서 이동과 조작을 동시에 학습하는 방법을 제시한다.
- #309Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening
PPO의 크리틱 학습에서 발생하는 Value Flattening 문제를 분석하고, SP^3O를 제안하여 이를 완화시킨다.
- #310SCOUT: Sim-to-Real Text-Based Person Retrieval by Embedding-Space Prediction over Frozen Video Features
SCOUT은 고정된 인코더를 사용해 시뮬레이션-실제 갭에서 텍스트 기반 인물 검색을 수행하며, AI City Challenge 2026에서 84.25 mAP@10 성능을 달성한다.
- #311Confidence Comes from Experience: Experiential Confidence Estimation from Reasoning to Agents
XConf는 모델의 과거 경험을 기반으로 신뢰도를 추정하는 새로운 패러다임으로, 기존 추정 방식 대비 낮은 비용과 높은 정확도를 달성한다.
- #312DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression
DeepSeek-V4.1-Flash는 KV 캐시 압축 기술을 통해 1M 토큰 컨텍스트를 처리하는 552B 파라미터 MoE 모델로, KV 캐시 용량을 기존 모델 대비 1/4~1/8로 줄였다.
- #313ProgramDistill: From Interactive Web Apps to Verifiable Reference-Guided SWE Tasks
ProgramDistill은 실행 가능한 웹 애플리케이션에서 추출한 4,063개의 SWE 태스크로, GPT-6 Astra가 49.2% 성공률을 기록한 벤치마크이다.
- #314Agora: Git as Shared Memory for Collective AutoResearch
Agora는 Git 기반의 공유 메모리 시스템으로, 자율 연구 에이전트 간 협업을 촉진하고 중복 탐색을 줄인다.
- #315SoL-Pi: Recursively Scaling Auto-Research Loops for Efficient Agent Harness
SoL-Pi는 자동 연구 루프를 통해 토큰 효율성을 44.7–49.0% 개선한 에이전트 헤이버스 시스템이다.
- #316An Empirical Study of Harness Design for Coding Agents
코드 생성 에이전트의 하네스 성능을 모듈별로 분석한 실험 연구.
- #317VC-Attention: Value Smoothing and Softmax Casting for Low-bit Attention
VC-Attention은 비트 수를 줄인 상태에서 정확도와 속도를 동시에 향상시키는 트레이닝 없는 어텐션 기법이다.
- #318Generalized Agent Iteration: One Formal Framework for Iterative Policy Improvement and Recursive Self-Improvement
GAI(Generalized Agent Iteration)는 GPI와 RSI를 하나의 학습 패러다임으로 통합하는 공식적 프레임워크를 제안한다.
- #319EvolveTrade: Experience-Driven Policy Refinement for Self-Evolving LLM Trading Agents
EvolveTrade는 LLM 거래 에이전트의 정책을 거래 경험에 따라 스스로 개선하는 자가 진화 프레임워크이다.
- #320HypoEvolve: Genetic Algorithms Enable Multi-Agent LLMs to Discover Scientific Hypotheses
HypoEvolve는 과학적 가설의 질을 향상시키기 위해 유전 알고리즘을 활용한 다 에이전트 LLM 시스템이다.