- #2TableBench: A Comprehensive and Complex Benchmark for Table Question Answering
TableBench는 18개 분야의 복잡한 TableQA 능력을 평가하는 새로운 벤치마크로, GPT-4조차 인간 수준에 도달하지 못함을 보여준다.
- #4BABILong: Testing the Limits of LLMs with Long Context Reasoning-in-a-Haystack
BABILong 벤치마크는 LLM이 긴 문서 내 분산된 사실을 추론하는 능력을 평가하며, 최대 5000만 토큰 처리 가능 모델을 제시한다.
- #5MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer
MaskGCT는 정렬 정보와 단위별 지속 시간 예측 없이, 마스킹-예측 학습을 기반으로 100K 시간의 데이터에서 최고 수준의 제로샷 TTS 성능을 달성한 2단계 비자귀적 모델이다.
- #6Emotion-LLaMA: Multimodal Emotion Recognition and Reasoning with Instruction Tuning
Emotion-LLaMA는 멀티모달 감정 인식과 추론을 위해 MERR 데이터셋과 instruction tuning 기법을 결합한 최신 모델로, 다양한 데이터셋에서 뛰어난 성능을 보인다.
- #7Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models
Hi Robot은 복잡한 언어 지시와 피드백을 처리하는 계층적 시각-언어-액션(VLA) 모델을 사용하여 오픈엔드 작업 수행이 가능한 로봇 시스템이다.
- #8Fast Timing-Conditioned Latent Audio Diffusion
Stable Audio는 텍스트와 타이밍 조건을 기반으로 44.1kHz 스테레오 오디오를 빠르게 생성하는 라티언트 디퓨전 모델이다.
- #93D Gaussian Splatting as Markov Chain Monte Carlo
3D Gaussian Splatting을 MCMC 샘플링으로 재구성하여 초기화와 휴리스틱을 제거하고 렌더링 품질을 향상시킨다.
- #10Assessing the Brittleness of Safety Alignment via Pruning and Low-Rank Modifications
LLM의 안전 메커니즘이 3% 이하의 파라미터와 2.5% 이하의 랭크만으로 구성되어 있어 취약하다는 점을 실증적으로 밝힘.
- #11No Pose, No Problem: Surprisingly Simple 3D Gaussian Splats from Sparse Unposed Images
NoPoSplat은 카메라 포즈 없이 3D 가우시안을 실시간으로 재구성하는 단순한 피드포워드 모델이다.
- #12SWE-smith: Scaling Data for Software Engineering Agents
SWE-smith는 소프트웨어 엔지니어링 에이전트 학습 데이터를 대규모로 생성하는 파이프라인으로, 128개 리포지토리에서 50,000개의 인스턴스를 생성해 기존 방식 대비 10배 규모 확장.
- #307The Price of Sparsity: Sufficient Conditions for Sparse Recovery using Sparse and Sparsified Measurements
이 연구는 희소 측정 행렬을 사용한 희소 신호의 support recovery에 대한 정보 이론적 한계와 trade-off를 분석한다.
- #313X-AuT: Progressive Audio-Encoder Compression for Speech LLMs with Cross-Scale Distillation
X-AuT는 Qwen3-ASR 모델의 오디오 인코더를 점진적으로 압축하면서 정확도를 유지하는 프레임워크로, 14층 모델에서 20.7%의 파라미터 감소와 5.75%의 매크로 오류를 달성한다.
- #315An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics
Nemotron-3-Ultra 기반 시스템이 2026년 국제수학올림피아드에서 42점 중 30점 획득하며 금메달 기준 달성.
- #316FreeFlow: A Bias-free Hierarchical Transformer for Optical Flow Estimation
FreeFlow는 기존의 흐름 추정에서 사용되던 편향 요소를 배제한 히에라키형 트랜스포머로, Sintel, KITTI-2015, Spring에서 최신 성능을 달성한다.
- #317MetroLLM-Bench: Evaluating Language Models as Transit Kiosk Runtimes
MetroLLM-Bench는 대중교통 키오스크 정책 실행을 위한 언어 모델 평가 벤치마크로, 4B Qwen 3.5 학생 모델이 GPT-5.6을 초과하며 2.6GB의 낮은 메모리 요구를 보인다.
- #318HyQuant: Hybrid-Precision Quantization for LLM Attention
HyQuant는 LLM의 어텐션 모듈을 혼합 정밀도로 양자화하여 정확도와 효율성을 균형 있게 유지하는 프레임워크이다.
- #319Negative Self-Distillation: Learning to Reason by Avoiding Flaws
NSD는 LLM이 스스로 생성한 오류 추론을 피하도록 훈련하여 수학적 추론 성능을 향상시키는 새로운 자기 부트스트랩 프레임워크이다.
- #320TempCloze: Can Video-LLMs Identify the Missing Middle?
TempCloze는 영상 기반 대형 언어 모델의 시각적 시간 추론 능력을 평가하기 위한 새로운 비디오 클로즈 벤치마크이다.
- #321Studying Image Tokenizers as Visual Languages in Unified Multimodal Models
이미지 토크나이저가 통합 멀티모달 모델에서 어떻게 텍스트와 상호작용하는지, 손실 기반 실험을 통해 분석한다.
- #322Recursive Code World Models: Building Complex Worlds through Recursive Scene Programs
RCWM은 단일 이미지에서 재귀적 코드 프로그램을 생성해 복잡한 3D 세계를 재구성하는 새로운 프레임워크이다.
- #323World in World: Explore the World with World Models
World in World(WiW)는 학습 없이 동영상 월드 모델을 다양한 시점에서 제어하는 시각적 증거 인터페이스를 제시한다.
- #324Building Multilingual Bridges: Data Mixing as the Pillar of Generalization for In-Language Reasoning
3.35B 규모의 Tiny Aya L2-Thinker 모델을 통해 60개 언어에서 93% 이상의 L2 추론률을 달성하며, 다국어 추론 성능을 확장하는 데이터 중심 접근법을 제시한다.
- #325Beyond Solver Verdicts: Generative Reward Models for Autoformalization
GenV+HN은 Z3 기반 오프라인 검증 정보를 활용해 참조-동등성을 검증하는 생성적 검증 모델로, 0.961 AUROC 성능을 달성하고 11.3포인트의 정확도 향상을 유도한다.
- #326Generative Late-Interaction Embeddings For Visual Document Retrieval
GLIE는 저장 공간 효율성을 유지하면서도 정확도를 보존하는 새로운 후처리 기반의 시각 문서 검색 방법이다.
- #327UniH^3: Unifying Hierarchical Homogeneity and Heterogeneity for All-in-One Medical Image Restoration
UniH3는 의료 이미지 복원의 다중 태스크와 모달리티를 통합하는 새로운 프레임워크로, 계층적 동질성과 이질성을 동시에 모델링한다.
- #328CARDEA: Auditable Reasoning Grounded in Spatial Evidence for End-to-End Coronary Angiography Interpretation
CARDEA는 강력한 시각-언어 모델과 Chain-of-Box 추론을 결합해 치료 결정을 지지하는 체계적 CAG 해석 파이프라인을 제공한다.
- #330Adaptive Bridge: A Proxy-Based Decoupling Layer for Mitigating DDS Backpressure in ROS 2
Adaptive Bridge는 ROS 2의 DDS 백프레셔 문제를 해결하기 위해 주요 구독자를 분리하는 프록시 기반 레이어를 제안한다.
- #331Think Before You Link: Rarity, Reasoning, and Retrieval in Multilingual Entity Linking
다국어 다모달 엔티티 링킹에서 희귀 엔티티 처리를 위해 추론과 검색을 결합한 훈련 없는 프레임워크를 제안한다.
- #332ActReview: Rebuttal-Guided Training Data and Rubric Rewards for Actionable Peer Review Generation
ActReview는 저자 반박을 활용한 행동 가능한 피어 리뷰 생성을 위한 후-트레이닝 프레임워크로, 진단 생성과 수정 제안 생성을 구조화하여 리뷰 품질을 향상시킨다.
- #333IdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications
IdeaAMBIG는 연구 아이디어의 구현 준비 상태를 평가하기 위한 660개의 구체적 결함 인스턴스를 포함한 벤치마크로, LLM이 결함을 탐지하고 명확히 하기 어려움을 보여준다.