- #2OmniRe: Omni Urban Scene Reconstruction
OmniRe는 다양한 동적 객체를 포함한 도시 장면을 고정밀로 재구성하는 시스템으로, 60Hz 실시간 시뮬레이션과 인간 행동 시뮬레이션을 지원한다.
- #3RoboSpatial: Teaching Spatial Understanding to 2D and 3D Vision-Language Models for Robotics
RoboSpatial은 2D 및 3D 시각-언어 모델의 공간 이해 능력을 향상시키기 위해 설계된 대규모 로봇용 데이터셋이다.
- #4MediQ: Question-Asking LLMs and a Benchmark for Reliable Interactive Clinical Reasoning
MediQ는 의료 상황에서 신뢰할 수 있는 대화형 추론을 위해 설계된 새로운 벤치마크와 질문 제기 시스템을 제시한다.
- #6TabICL: A Tabular Foundation Model for In-Context Learning on Large Data
TabICL은 대규모 테이블 데이터 처리를 위한 ICL 기반 탭러블 펀다멘탈 모델로, 500K 샘플 처리가 가능하며 기존 모델 대비 최대 10배 빠르다.
- #7PaperBench: Evaluating AI's Ability to Replicate AI Research
PaperBench는 AI 에이전트가 최신 AI 연구를 복제하는 능력을 평가하는 벤치마크로, 21.0%의 최고 점수를 기록한 Claude 3.5 Sonnet가 인간 기준(41.4%)에는 미치지 못함.
- #8Training Language Models to Reason Efficiently
LLM의 추론 비용을 줄이기 위해 강화학습을 활용해 사고 과정을 효율적으로 학습하는 방법을 제안한다.
- #9SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
SALAD-Bench는 LLM의 안전성, 공격, 방어를 종합적으로 평가하기 위한 계층적 벤치마크로, MD-Judge와 MCQ-Judge 평가자와 함께 제공된다.
- #10Actions Speak Louder than Words: Trillion-Parameter Sequential Transducers for Generative Recommendations
1.5trillion 파라미터를 가진 HSTU 기반 Generative Recommenders가 기존 DLRM 대비 12.4% 성능 향상과 5.3x~15.2x 속도 개선을 달성했다.
- #11SVD-LLM: Truncation-aware Singular Value Decomposition for Large Language Model Compression
SVD-LLM은 SVD 기반의 LLM 압축 방법으로, 잘린 특이값과 압축 손실 간의 직접적인 매핑을 보장하는 데이터 화이트닝 기법과 정확도 회복을 위한 순차적 저랭크 근사 기법을 결합하여 높은 압축률에서도 우수한 성능을 보인다.
- #12AgentBoard: An Analytical Evaluation Board of Multi-turn LLM Agents
AgentBoard는 다단계 대화형 LLM 에이전트를 분석적으로 평가하기 위한 벤치마크 및 오픈소스 평가 프레임워크이다.
- #304Dr. Claw: An AI Scientist Workspace for Vibe Research
Dr. Claw는 기존 명령줄 코드 에이전트를 감싸며 연구 과정을 추적 가능하고 복구 가능한 루프로 통합한 오픈소스 연구 워크스페이스이다.
- #305Bilevel Coordinated Reflection: A Game-Theoretic Approach to Multi-Agent LLM Systems
다중 에이전트 LLM 시스템에서 SRMA 알고리즘을 도입하여 반영 과정을 게임 이론적 구조로 모델링하고, 72.2%의 SWE-bench 성능 달성.
- #306UniMate: One Unified Model to Animate Diverse Skeletons
UniMate는 다양한 스켈레톤에 텍스트 프롬프트만으로 움직임을 생성하는 통합 기반 모델로, 테스트 시 최적화 없이도 Zero-shot 전이를 지원한다.
- #307Unlocking Lossless Speedups in LLMs via Discrete Diffusion
Uno는 확률 확산을 활용해 대형 언어 모델의 속도를 3배까지 향상시키는 새로운 구조를 제시한다.
- #308Iris: Climbing to the Search Frontier
Iris-mini와 Iris-pro는 35B-A3B와 397B-A17B 규모로 학습된 검색 에이전트로, SFT-RL climbing을 통해 강력한 성능을 달성했다.
- #309Verify Before You Distill: Prompt-Level Teacher Gating for On-Policy Distillation
TGOPD는 토큰 수준의 지도 신뢰성을 프롬프트 단위로 검증하여 Vanilla OPD를 개선한 새로운 온-정책 디스틸레이션 방법이다.
- #310FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience
FlowBalance는 검증기 기반의 자기 개선을 통해 수학적 추론 성능과 훈련 안정성을 동시에 향상시키는 정규화된 응답 분포 학습 방법이다.
- #312Motion-Omni: End-to-End Joint Speech and Full-Body Motion for Spoken Dialogue
Motion-Omni는 대화 중 말과 동작을 동시에 생성하는 엔드투엔드 프레임워크로, 말과 몸짓을 동일한 상태에서 생성하여 실시간 성능과 정확도를 동시에 향상시킨다.
- #314The Attention Triangle in Audio-Video Models
음성-비디오 디퓨전 모델에서 주의 메커니즘의 삼각 구조를 분석하고, 이를 기반으로 의미 누수를 진단 및 완화하는 방법을 제시한다.
- #315Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal
Qwen3-8B 모델을 대상으로, 정책에 따른 좁은 경계 안전 거부를 학습하는 오프라인 자가 생성 프레임워크를 제시하고, 경계 정확도와 안전성-사용성의 균형을 평가한다.
- #318ShallowStream: Index Shallow then Answer Deep for Streaming Video Understanding
ShallowStream은 MLLM의 얕은 계층을 활용해 실시간 동영상 처리 비용을 52.1배 감소시키는 새로운 스트리밍 비디오 이해 프레임워크이다.
- #319WorldSculpt: Generating Compositional Worlds from Grounded Videos
WorldSculpt는 Pixal3D를 다중 뷰 조건화 경로로 확장하여 밀집된 장면에서도 개별 객체 메시를 생성하는 3D 합성 프레임워크이다.
- #320Enoki: Efficient Multi-Level Hallucination Detection
Enoki는 OpenIE 기반 다중 수준 hallucination 탐지 프레임워크로, claim-level 검증과 span-level 로컬라이제이션을 공유된 표현으로 통합하여 효율성을 높인다.
- #322ENEAS: Embedding-guided Neural Ensemble for Adaptive Segmentation
ENEAS는 텍스트 프롬프트 기반의 인스턴스 추적과 의미적 탐지 문제를 해결하기 위한 신경망 앙상블 모델이다.
- #323Ask Before You Optimize: Dynamic Pre-Formulation Clarification for Interactive Optimization
InterOPT은 OR-Clarify 벤치마크를 통해 미완전한 최적화 문제 설명에서 필요한 정보를 선택적으로 명확히 하며, 모델링 전 준비 여부를 판단하는 시스템이다.
- #324Don't Drop Dropout: Optimizing Layer Sparsity for Efficient LLM Training and Inference
레이어 드롭아웃을 최적화하여 LLM의 학습 및 추론 효율성을 동시에 향상시킨다.
- #327Beneath the Surface of Chains-of-Thought: A Mechanistic Interpretation of Reasoning Operations in LLMs
LLM 내 사고 과정의 내부 기하 구조를 기계적 해석한 연구로, 중간 층에서 사고 연산의 분리도가 가장 높음.
- #329MaxKernel: Agentic Kernel Generation for TPUs
MaxKernel은 TPU 커널 최적화를 위한 3가지 에이전트 패러다임을 갖춘 시스템으로, JAXBench에서 1.58× 평균 가속을 달성한다.
- #330One Symptom, Three Levers: A Critical Review of On-Policy Self-Distillation
On-Policy Self-Distillation(자기 교사 정제)은 외부 교사 모델 없이 자기 자신을 교사로 사용하는 학습 방식으로, 수학적 추론에서 성능을 유지하면서 생성 토큰 수를 줄이는 가능성을 제시하지만, 추론 경로의 다양성 감소(콜랩스)라는 주요 문제를 동반한다.
- #331EmbodiedSkills: A Unified Framework for Orchestrating, Training, and Deploying VLA Agents
EmbodiedSkills는 VLA 정책을 닫힌 루프 에이전트로 변환하는 실행-검증-복구 프레임워크로, RoboTwin 2.0에서 86.20% 성공률을 달성한다.