- #1General-Reasoner: Advancing LLM Reasoning Across All Domains
General-Reasoner는 수학 외 다양한 분야에서 LLM의 추론 능력을 향상시키는 새로운 훈련 패러다임이다.
- #2When Does Domain Adaptation Help on Physical Vibration Sensors? A Held-Out-Bearing Study of Neural-Operator and Convolutional Models
회전 속도 변화에 따른 베어링 고장 진단에서 입력 표현이 도메인 적응 성능에 결정적 영향을 미친다는 것을 Fourier Neural Operator와 CNN 비교를 통해 입증.
- #3Recursive Harness Distillation across Agents for Robot Manipulation
- #4VisionHOPE: Visual Backbones as Self-Modifying Learning Systems
- #5Deep Reinforcement Learning for Robotics: A Survey of Real-World Successes
DRL을 활용한 로봇 제어 기술의 실제 성공 사례와 주요 과제를 종합적으로 조사한 리뷰 논문.
- #6Adaptive Keyframe Sampling for Long Video Understanding
Adaptive Keyframe Sampling(AKS)는 장시간 동영상 이해를 위한 MLLM의 토큰 선택 정확도를 향상시키는 모듈로, LongVideoBench와 VideoMME에서 기존 기준선 대비 높은 정확도를 달성한다.
- #7OpenMathInstruct-2: Accelerating AI for Math with Massive Open-Source Instruction Data
OpenMathInstruct-2는 Llama3.1을 활용해 생성된 14M개의 수학 문제-해답 쌍을 포함한 오픈소스 학습 데이터셋으로, Llama3.1-8B-Base 모델을 fine-tuning한 결과 MATH 데이터셋에서 15.9% 성능 향상을 달성했다.
- #8Debug like a Human: A Large Language Model Debugger via Verifying Runtime Execution Step by Step
LDB는 실행 시점 정보를 활용해 생성된 코드를 단계별로 검증하는 LLM 디버깅 프레임워크로, HumanEval 등 3개 벤치마크에서 최대 9.8% 성능 향상.
- #9Recursive Introspection: Teaching Language Model Agents How to Self-Improve
RISE는 LLM이 단계적으로 자기 개선할 수 있도록 훈련하는 반복적 미세조정 알고리즘으로, 수학 추론 성능을 향상시킨다.
- #10Make Your LLM Fully Utilize the Context
FILM-7B는 IN2 훈련을 통해 32K 토큰 컨텍스트 내 중간 정보를 효과적으로 활용하는 LLM을 제시한다.
- #11Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement Learning
Memory-R1은 강화학습을 통해 LLM이 외부 메모리를 적극적으로 관리하고 활용할 수 있도록 하는 첫 번째 프레임워크이다.
- #12HQ-Edit: A High-Quality Dataset for Instruction-based Image Editing
HQ-Edit는 GPT-4V와 DALL-E 3를 활용한 20만 개의 고해상도 이미지 편집 데이터셋으로, 기존 모델보다 편집 정확도를 12.3% 향상시킨다.
- #13LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token
LLaVA-Mini는 1개의 시각 토큰만으로도 LLaVA-v1.5와 유사한 성능을 달성하는 효율적인 멀티모달 모델이다.
- #279Groupwise Agentic Grading and Advantage Redistribution for Code Agent RL
- #305Post-Training Leaves Behavioral Shadows on Unrelated Decisions
Active Taskless Distillation(ATD)를 통해 단일 단어만으로 사후 학습 정보를 전달하고, HumanEval+에서 5.34pp 성능 향상.
- #306Beyond Teacher Assignment: Domain-Normalized Multi-Teacher On-Policy Distillation
DN-MOPD는 전문가 모델들의 피드백 스케일을 정규화하여 MOPD의 성능 한계를 극복하고, 수학 능력 향상과 다중 태스크 성능 향상을 달성한다.
- #307WorldPlay2: Extending Real-Time Interactive World Models in Control and Horizon
WorldPlay2는 실시간 대응과 장기 일관성을 갖춘 하이브리드 제어 인터페이스와 안정적 지도를 결합한 대규모 인터랙티브 월드 모델이다.
- #308Imprint Reader: From Weight-Update Readout to Behavioral Intervention
Imprint Reader는 가중치 업데이트를 자연어로 해독하고 행동 개입을 가능하게 하는 체계적 접근법을 제시한다.
- #309Residual Transferability in Neural Image Watermarking
- #310Adapting Vision-Language Models for Human-Readable XAI in Industrial Object Detection
비전-언어 모델을 활용한 인간 중심 XAI 인터페이스를 제안하여 산업 현장에서의 AI 설명 가능성 향상.
- #311How Far Are We from Removing the Visual Encoder? Scaling Laws for Encoder-Free Multimodal Pretraining
시각 인코더를 제거한 MLLM이 10²² FLOPs 규모에서 기존 인코더 기반 모델과 성능이 수렴할 수 있음을 규모 법칙을 통해 밝힘.
- #312Learning Native Reflection in Unified Models with Interleaved Reinforcement Learning
UMM-Reflection은 단일 통합 모델 내에서 반복적 이미지 수정을 학습하는 강화학습 기반 반사 학습 프레임워크로, GenEval에서 SFT 대비 12.05점 개선을 달성한다.
- #313SentZero: An Enhanced Sentence-Centric Vision-Language Pretraining for Multi-Task Zero-Shot Chest X-Ray Analysis
SentZero는 병원성 문장 구조를 활용한 새로운 시각-언어 사전 학습 프레임워크로, 병원 흉부 X선 분석에서 제로샷 성능을 향상시킨다.
- #314QwenGyre: An Elastic Reinforcement Learning Framework for Training xLong-Horizon Agents
QwenGyre는 xLong-horizon RL에서 GPU 재할당과 트래젝토리 처리를 통해 1.85× 가속을 달성한 엘라스틱 RL 프레임워크이다.
- #315In-Flight KV Cache with Clean Anchors for Faster Autoregressive Video Diffusion
FlashForward는 자동 회귀 비디오 생성에서 KV 캐시 재사용을 통해 1.42–2.92배 빠른 생성 속도를 달성한 방법이다.
- #316Change the Product, Keep the Parameters: Associative Algebra Layers for Transformers
Transformer의 행렬 곱셈 규칙을 대수적 구조로 대체하여 연산량을 줄이며 생성 속도를 6.2–7.8% 향상시킨다.
- #317WideSWE: Can Coding Agents Coordinate Changes Across Repositories?
WideSWE는 여러 레포지토리 간 조율이 필요한 실제 개발 작업을 평가하는 벤치마크로, 최대 42.50%의 작업 성공률을 보임.
- #318FlowTool: Controlling Tool Parameter in Image Retouching via Flow Matching
FlowTool은 이미지 리터치 작업에서 툴 파라미터를 조절하기 위해 흐름 매칭을 활용한 새로운 프레임워크이다.
- #319Structured Residual Connectivity Matters for Diffusion Transformers
Diffusion Transformers에서 구조화된 잔차 연결을 도입해 FID 1.39 달성 및 1.73× 빠른 수렴을 실현.
- #320Hard Vision, Easy Vision: What GPT-6 Astra Reveals Across Computer Vision
GPT-6 Astra는 시각 추론과 구조화된 예측에서 기존 최첨단 시스템을 앞선다.