- #1RoboTwin: Dual-Arm Robot Benchmark with Generative Digital Twins
RoboTwin은 3D 생성 모델과 대형 언어 모델을 결합한 디지털 트윈 프레임워크로, 이중 팔 로봇 조작 성능을 70% 이상 향상시킨다.
- #2In-Context Robot Learning with VLM Agents
GPT-Policy는 VLM을 활용한 실시간 컨텍스트 학습을 통해 로봇 행동을 생성하고 검증하는 새로운 로봇 학습 프레임워크이다.
- #3Confidence Comes from Experience: Experiential Confidence Estimation from Reasoning to Agents
XConf는 모델의 과거 경험을 기반으로 신뢰도를 추정하는 새로운 패러다임으로, 기존 추정 방식 대비 낮은 비용과 높은 정확도를 달성한다.
- #4EvolveTrade: Experience-Driven Policy Refinement for Self-Evolving LLM Trading Agents
EvolveTrade는 LLM 거래 에이전트의 정책을 거래 경험에 따라 스스로 개선하는 자가 진화 프레임워크이다.
- #5SpectralShift: Effective Context Window Extension of Gated DeltaNet via Spectral Reparameterization
SpectralShift는 Gated DeltaNet의 컨텍스트 확장을 위해 스펙트럼 재매개변수화를 통해 장거리 정보 전달 능력을 향상시키는 방법이다.
- #6VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction
VITA-1.5는 시각·언어·음성 통합을 위한 3단계 훈련 전략을 통해 실시간 멀티모달 대화를 구현한 모델이다.
- #7Extreme Compression of Large Language Models via Additive Quantization
AQLM은 2~3비트로 대규모 언어 모델을 압축하면서 정확도를 유지하는 새로운 추가 양자화 기법이다.
- #8Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence
Spatial-MLLM은 2D 영상 입력만으로 시각 기반 공간 지능을 향상시키는 이중 인코더-연결기 구조의 새로운 MLLM 프레임워크이다.
- #9Infrared Small Target Detection with Scale and Location Sensitivity
적외선 소형 타겟 탐지에서 SLS 손실과 MSHNet을 통해 기존 방법 대비 우수한 성능을 달성했다.
- #10The Good and The Bad: Exploring Privacy Issues in Retrieval-Augmented Generation (RAG)
RAG 시스템은 검색 데이터 유출에 취약하지만, LLM 학습 데이터 유출은 줄일 수 있다는 새로운 통찰을 제시한다.
- #11TTRL: Test-Time Reinforcement Learning
TTRL은 라벨 없는 데이터에서 강화학습을 통해 대형 언어 모델을 테스트 시간에 자가 진화시키는 새로운 방법이다.
- #12Patchscopes: A Unifying Framework for Inspecting Hidden Representations of Language Models
Patchscopes는 LLM 내부 표현을 해석하기 위한 통합적이고 유연한 프레임워크로, 기존 방법의 한계를 극복하고 새로운 해석 가능성과 오류 수정 기능을 제공한다.
- #13InstanceDiffusion: Instance-Level Control for Image Generation
InstanceDiffusion은 인스턴스 수준의 위치와 속성 제어를 가능하게 하는 텍스트-이미지 생성 모델로, COCO 데이터셋에서 기존 모델 대비 20.4% AP<sub>50</sub><sup>box</sup> 및 25.4% IoU 개선을 달성했다.
- #14AnyEdit: Mastering Unified High-Quality Image Editing for Any Idea
AnyEdit는 2.5M 개의 고질량 편집 쌍을 포함한 다모달 편집 데이터셋과 AnySD라는 새로운 통합 이미지 편집 모델을 제안하여 다양한 편집 작업에서 성능을 향상시킨다.
- #298Lecture notes on Physics Informed Neural Networks, Neural Operators, and their applications
물리 정보 신경망과 신경 연산자의 개념 및 실제 적용을 다룬 강의 노트.
- #303Continual Learning Mechanisms Compose for Long-Horizon Memorization
100개의 순차적 작업 학습에서 34.9%의 최종 기억률을 달성한 복합 메커니즘 조합 연구.
- #304FLAT: Resampling Image and Text into 1D Flexible-Length Aligned Transmodal Tokens for Retrieval and Generation
FLAT은 이미지와 텍스트를 1D 연속 시퀀스로 변환하여 생성과 검색을 통합하는 다중모달 학습 프레임워크로, T2I GenEval 83.1, MS-COCO BLEU-4 40.5 등 SOTA 성능을 달성한다.
- #308The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement
AI가 경험을 기반으로 스스로 개선하는 RSI 개념을 제시하고, 구현 단계와 주요 도전점을 분석한다.
- #309Zing-0.5: Toward Playable Worlds with Real-Time Joint Action and Text Control
Zing-0.5는 실시간 키보드와 텍스트 제어를 결합한 5B 규모의 생성 세계 모델로, WBench Navigation에서 81.0의 종합 점수를 달성했다.
- #310AI for Games in the Foundation Model Era
게임 AI 분야에서 기초 모델이 다양한 역할을 수행하며, 그간 분리되어 발전한 연구 주제들이 통합되고 있다.
- #311StepAudio 3 Realtime Technical Report
StepAudio 3 Realtime은 Think-While-Speaking을 통해 실시간 대화 중 사고와 응답을 병행하는 오디오-언어 기반 모델로, MMSU 90.6, τ-Voice 56.0% 등 주요 지표에서 뛰어난 성능을 보인다.
- #312LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence
LimiX-2는 Contextual Mechanism Networks(CMNs)를 기반으로, CCMM을 통해 학습된 다목적 테이블 데이터 지능 모델로, TabArena, TALENT, BCCO에서 기존 모델을 상회하며 인과성도 반영한다.
- #313StepAudio 3 Music Technical Report
StepAudio 3 Music은 ABC-CoT 기반의 음악 계획과 텍스트 제어를 지원하는 대규모 장시간 음악 생성 모델이다.
- #314ScienceIDE: Turning World's Scientific Codebase into Agent Learnable Environments
ScienceIDE는 과학 코드베이스를 학습 가능한 환경으로 전환하여 과학적 경험을 기반으로 AI 에이전트를 훈련하는 인프라를 제시한다.
- #315Fingers as Legs: Learning Self-Supported Locomotion and Manipulation with an Anthropomorphic Hand
인간 손 형태의 로봇이 위치 제어기를 유지하면서 이동과 조작을 동시에 학습하는 방법을 제시한다.
- #316Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening
PPO의 크리틱 학습에서 발생하는 Value Flattening 문제를 분석하고, SP^3O를 제안하여 이를 완화시킨다.
- #317Generalized Agent Iteration: One Formal Framework for Iterative Policy Improvement and Recursive Self-Improvement
GAI(Generalized Agent Iteration)는 GPI와 RSI를 하나의 학습 패러다임으로 통합하는 공식적 프레임워크를 제안한다.
- #318ProgramDistill: From Interactive Web Apps to Verifiable Reference-Guided SWE Tasks
ProgramDistill은 실행 가능한 웹 애플리케이션에서 추출한 4,063개의 SWE 태스크로, GPT-6 Astra가 49.2% 성공률을 기록한 벤치마크이다.
- #319ActionPiece: Rethinking Action Tokenization for Autoregressive Vision-Language-Action Models
ActionPiece는 물리적 관계를 고려한 액션 토크나이저로, VLA 모델에서 정확한 제어를 위해 PRC와 QR을 결합한 학습 방식을 제안한다.
- #320Agora: Git as Shared Memory for Collective AutoResearch
Agora는 Git 기반의 공유 메모리 시스템으로, 자율 연구 에이전트 간 협업을 촉진하고 중복 탐색을 줄인다.