- #1ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model
ChatVLA는 Phased Alignment Training과 Mixture-of-Experts를 결합해 MMMU에서 6배, MMStar에서 47.2% 성능을 달성한 통합형 VLA 모델이다.
- #2VISA: Reasoning Video Object Segmentation via Large Language Models
VISA는 대규모 언어 모델을 활용해 암묵적 텍스트 쿼리에 기반한 비디오 객체 분할을 수행하는 새로운 ReasonVOS 태스크를 제안한다.
- #3Training Deep Learning Models with Norm-Constrained LMOs
Scion이라는 새로운 LMO 기반 최적화 알고리즘을 제안하여 nanoGPT 학습 속도를 향상시키고 메모리 효율성을 확보한다.
- #4Which Agent Causes Task Failures and When? On Automated Failure Attribution of LLM Multi-Agent Systems
LLM 멀티에이전트 시스템의 실패 원인을 자동으로 추적하는 새로운 연구 분야를 제안하고, 실패 로그를 기반으로 한 Who&When 데이터셋을 소개한다.
- #5When Attention Sink Emerges in Language Models: An Empirical View
언어 모델에서 첫 번째 토큰에 과도한 어텐션(attention sink)이 발생하는 현상을 실증적으로 분석하고, 이 현상이 학습 과정과 어텐션 구조에 어떻게 영향을 받는지 밝힌다.
- #6Scaling up Masked Diffusion Models on Text
1.1B 매스킹 디퓨전 모델(MDM)이 자동회귀 모델(ARM)과 유사한 성능을 보이며, 수학 추론 및 샘플링 속도에서 우수함.
- #7VideoScore: Building Automatic Metrics to Simulate Fine-grained Human Feedback for Video Generation
VideoScore는 37.6K개의 영상에 대한 인간 평가를 기반으로 학습하여, 기존 지표 대비 50점 이상 높은 상관계수(77.1)를 달성한 자동 영상 평가 모델이다.
- #8IRSAM: Advancing Segment Anything Model for Infrared Small Target Detection
IRSAM은 적외선 소형 타겟 탐지(IRSTD)를 위해 SAM의 인코더-디코더 구조를 개선한 모델로, WPMD와 GAD 모듈을 통해 성능을 크게 향상시킨다.
- #9Probing the 3D Awareness of Visual Foundation Models
시각 기초 모델이 3D 구조를 얼마나 잘 인식하는지 탐구한 연구로, DINOv2와 StableDiffusion이 2D 학습에도 3D 정보를 부분적으로 인코딩함을 밝힘.
- #10InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD
InternLM-XComposer2-4KHD는 4K HD 해상도까지 처리 가능한 최초의 대규모 시각-언어 모델로, 10개 벤치마크에서 GPT-4V와 Gemini Pro를 능가한다.
- #301Memadapter: Counterfactual Adaptation Against Memory-induced Sycophancy
MemAdapter는 장기 기억 유도의 서코판시를 방지하기 위해 후처리 단계에서 기억 활용을 적응적으로 조절하는 프레임워크로, 3단계 구조로 구성되어 있음.
- #302MM-ABC: Towards Generalist Mobile Manipulation via Seeing, Coordinating and Imagining
MM-ABC는 이동 및 조작의 협업을 학습하는 모바일 조작 기반 모델로, 다양한 데이터에서 61.2% 성공률을 달성.
- #303Adapting prior-data fitted networks for tabular anomaly detection
TabPFN 기반의 사전 학습 모델을 적응시켜 탭류 데이터 이상 탐지를 개선하는 방법을 제안한다.
- #304Video2Skill: From Streaming Experience to Reusable Embodied Skills
Video2Skill은 스트리밍 영상에서 재사용 가능한 신체 기반 스킬을 발견하는 기준 평가 프레임워크로, 19개의 VLM 모델을 통해 스킬 그룹화 및 재사용 결정의 한계를 분석한다.
- #305ProgressCompass: Embodied Progress Reward Models Are Lost Without the Right Context
ProgressCompass는 적절한 컨텍스트를 제공함으로써, 복잡한 작업에서 Progress Reward Model(PRMs)의 정확도를 63% 개선하는 자율 에이전트 루프를 제안한다.
- #306Periscope: Extending Frozen Language Models Beyond Their Context Window
Periscope는 텍스트를 분할 읽고 결합하여 컨텍스트 윈도우를 확장하는 추론 방법으로, 27B 모델이 4.5M 토큰을 80GB GPU에서 처리 가능하다.
- #307In-Distribution Forcing for Long Video Generation at Test Time
- #308LMBuild: Evaluating LLM Agents for Generating Buildable and Functional Structures
LMBuild는 생성된 3D 구조물이 실제로 제작 가능하고 기능적으로 작동하는지 평가하는 체계적인 벤치마크를 제시한다.
- #309Foundations of Proactive Agents: Principles, Technical Layers, and Proactivity-Gym
이 연구는 3T(작업 능력, 시간 할당, 신뢰) 원칙을 기반으로 한 프로액티브 LLM 에이전트의 설계, 구현, 평가 기초를 제시하며, Proactivity-Gym이라는 시뮬레이션 평가 테스트베드를 소개한다.
- #310Self-Generated Feedback Destabilizes Test-Time Training: A Causal Decomposition of Long-Horizon Adaptation
- #311World Editing: Intervening on Executable Worlds at Increasing Depth
실행 가능한 게임 세계에 대한 의도적 편집 능력을 평가하는 IGMWorld와 IGMBench를 제안하며, 편집 깊이가 성능에 미치는 영향을 분석한다.
- #312GeoCR: Learning a Generalist Cloud Removal Prior from Heterogeneous Observations
- #313OpenRUA: Robot-Use Agents Are Zero-Shot Visuomotor Policies
OpenRUA는 ROS 2 인터페이스를 통해 코드 작성 에이전트가 제로샷으로 로봇 제어를 수행할 수 있음을 보여주는 제로-추상화 허네스 시스템이다.
- #314Optimizing the Optimizer: Language Models Discover Faster Molecular Relaxation
AutoSella는 언어 모델 기반 자동 연구를 통해 개선된 분자 기하 최적화 알고리즘으로, Sella 대비 40.2–77.2% 적은 힘 평가 수를 요구한다.
- #315Data Unlearning via Inverse Distillation
IDU는 다단계 매칭 모델을 효율적인 단계 생성자로 증류하면서 지정된 학습 집합을 억제하는 통합 프레임워크이다.
- #316Representation-Space MMD for Diffusion Language Models
DLM의 생성 품질을 향상시키기 위해 MMD 최적화를 기반으로 post-training을 수행하는 방법을 제안한다.
- #317OmniReasoning: Pushing the Limits of Audio-Visual Joint Reasoning
OmniReasoning-30B-A3B는 오디오-비주얼 결합 추론을 강화하기 위해 설계된 벤치마크, 데이터 엔진, 학습 방법을 제시하며 OmniReasoningBench에서 42.5% 성능을 달성한다.
- #318SearchJev: A Fast and Calibrated System-1 Model for Search Agents
SearchJev는 빠르고 신뢰도 높은 System-1 모델로, 검색 에이전트의 단기 결정을 직접 예측하고 System-2에 위임하는 이중 시스템을 제안한다.
- #319RobotUse: Allocating Computation, Context, and Decisions
RobotUse는 물리적 행동을 지정하고 수정하는 데 초점을 맞춘 로봇 에이전트 허네스를 제시하며, RoboLab에서 45%의 작업 성공률을 달성한다.
- #320Conformal Prediction with Paraphrase-Aware Scoring for LLM Uncertainty Quantification