- #2MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding
MedXpertQA는 4,460개의 전문의 수준 질문을 포함한, 의료 분야의 전문 지식과 고급 추론 능력을 평가하는 종합적 벤치마크이다.
- #4Agent Laboratory: Using LLM Agents as Research Assistants
LLM 에이전트 기반 연구 프레임워크인 Agent Laboratory가 연구 과정을 자동화하고 연구 비용을 84% 절감하는 것을 보여준다.
- #5VACE: All-in-One Video Creation and Editing
VACE는 다양한 비디오 생성 및 편집 작업을 하나의 모델로 통합한 All-in-One 프레임워크로, VCU와 Context Adapter를 통해 다중 조건 입력을 유연하게 처리한다.
- #6SpinQuant: LLM quantization with learned rotations
SpinQuant은 LLM의 4비트 양자화 성능을 회전 행렬 학습을 통해 2.9% 이하로 감소시키는 새로운 양자화 기법이다.
- #7TravelPlanner: A Benchmark for Real-World Planning with Language Agents
TravelPlanner는 실제 여행 계획을 기반으로 언어 에이전트의 복잡한 계획 능력을 평가하는 새로운 벤치마크로, GPT-4조차 0.6%의 성공률에 그친다.
- #8MonST3R: A Simple Approach for Estimating Geometry in the Presence of Motion
MonST3R은 동적 장면에서 직접 3D 기하를 추정하는 단순한 접근법으로, DUST3R의 포인트맵을 활용해 동작 없이도 높은 정확도를 보인다.
- #9Training Language Models to Self-Correct via Reinforcement Learning
SCoRe는 강화학습을 활용해 LLM이 자체적으로 오류를 수정하는 능력을 향상시키는 다단계 온라인 학습 방법이다.
- #10Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference
Quest는 쿼리에 따라 KV 캐시의 핵심 토큰을 선택적으로 처리하여, 긴 문맥의 LLM 추론 속도를 7.03× 가속화하는 알고리즘이다.
- #11Panda-70M: Captioning 70M Videos with Multiple Cross-Modality Teachers
Panda-70M은 7000만 개의 고해상도 영상에 텍스트 캡션을 부여한 대규모 자동 생성 데이터셋으로, 다중 교사 모델을 활용한 자동 캡셔닝 파이프라인을 제시한다.
- #12SliceGPT: Compress Large Language Models by Deleting Rows and Columns
SliceGPT는 행렬의 행/열을 제거해 LLM을 압축하는 post-training 스파스화 기법으로, 25% 파라미터 제거에도 90% 이상의 성능 유지.
- #317AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design
AutoDesign은 학술 논문을 포스터로 자동 생성하는 과정에서 인간 선호에 맞춘 재귀적 개선을 통해 78.32 점을 달성한 메타-해버 시스템 최적화 프레임워크이다.
- #318From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs
저주파 수음 불가 신호가 대규모 오디오-언어 모델(LALM)의 안정성에 심각한 위협을 가하며, 이를 평가하고 완화하기 위한 ILL과 DRG 방법이 제안된다.
- #319TailBooster: A Dual-Layer Generative Framework for Extreme Value Augmentation with Operational Validity Enforcement
TailBooster는 극단적 항공 운항 데이터를 생성하면서 운영 적합성을 보장하는 이중 계층 생성 프레임워크이다.
- #320CW-BASS v2: Saturation-Aware Pseudo-Label Selection for Semi-Supervised Segmentation under Foundation-Model Teachers
CW-BASS v2는 DINOv2와 같은 강력한 foundation 모델의 confidence saturation 현상을 고려한 pseudo-label 선택 방법이다.
- #322Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus
혼합형 선형 어텐션 대형 언어 모델(HLA LLM)에서 대규모 활성화(MA)의 두 가지 형태, pre-attention spikes(PAS)와 inter-spike plateaus(ISP)를 체계적으로 분석하고, 이들의 발생 메커니즘과 학습 과정에서의 변화를 밝혔다.
- #323LiveAnimate: Stable Long-Form Streaming Human Animation in Real-Time
LiveAnimate는 14B 파라미터 DiT 기반으로 실시간 스트리밍과 장시간 안정적 생성을 결합한 첫 번째 인간 애니메이션 시스템이다.
- #324UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos
UniSwap은 말하는 영상에서 시각적 외형과 음성을 실시간으로 통합 교체하는 첫 번째 스트리밍 프레임워크이다.
- #325Full-bandwidth transformer
Full-bandwidth transformer는 토큰 단위 피드백 대신 전체 히든 상태를 재사용해 추론 성능을 향상시키며, 1.5배 더 많은 토큰으로 학습한 모델과 유사한 결과를 낸다.
- #326Self-Geometry: GT-Free and Plug-and-Play Test-Time Adaptation for Geometrically Consistent 3D Vision Foundation Models
Self-Geometry는 테스트 시에 2D 픽셀 대응 관계를 활용해 기하학적 일관성을 강제하는 플러그 앤 플레이형 3D 비전 모델 적응 파이프라인이다.
- #327An AI4AI Framework for Visual Token Pruning
AutoPrune는 LLM 기반의 시각 토큰 정제 정책을 설계하는 AI4AI 프레임워크로, 94.4%의 토큰 제거에도 99% 이상의 성능을 유지한다.
- #330Thought-Level Beam Search for Reasoning
Gambit는 토큰 소비를 최대 68.5% 절감하면서도 AIME-25에서 +3.3%의 정확도 향상을 달성한 사고 수준 빔 서치 알고리즘입니다.
- #331OmniScientist: An Omni-Modal Omni-Discipline AI Scientist
OmniScientist는 다학문적 연구를 이종 원천 데이터에서 직접 수행하는 종단간 다모달 AI 과학자 시스템이다.
- #332Maglev: Sliding Recurrent Memory
Maglev는 슬라이딩 윈도우 어텐션을 일반화하면서 추론 시 고정 메모리로 작동하는 반복 트랜스포머 구조를 제안한다.
- #333Context-Matched Distillation: Teacher Causality for Autoregressive Video Distillation
Context-Matched Distillation(CMD)는 자율적 비디오 생성에서 교사-학생 간 정보 불일치를 해결하여 생성 품질과 제어 정확도를 향상시키는 인과적 지도 프레임워크이다.
- #334SKILLER: Language-Level Reinforcement Learning for Reusable Skill Extraction in Small Language Models
SKILLER는 소형 언어 모델에 맞춤형으로 스킬을 생성하는 자연어 기반 강화 학습 프레임워크로, Qwen3.5-9B와 Qwen3.5-4B에서 기존 방법 대비 최대 20.4%의 성능 향상을 달성했다.
- #335LycheeMemory V2: Efficient Long-Term Memory for LLM Agents via Semantic Segment-Level Consolidation
LycheeMemory V2는 세그먼트 단위의 의미 기반 메모리 통합을 통해 LLM 에이전트의 장기 메모리 효율성을 획기적으로 개선한 시스템이다.
- #336Hybrid-Policy Self-Editing for Composable Unstructured Knowledge Editing
HPSE는 주어진 텍스트를 기반으로 LLM의 지식을 편집하면서도 분해성과 구성성을 동시에 달성하는 새로운 자기-디스틸레이션 기반 편집 방법이다.
- #337Are You Sure You're Sure? On the Impact of Instruction Tuning on Confidence and Lexical Diversity
지시 학습은 모델의 답변 신뢰도를 높이지만, 이는 일관된 어휘 다양성 변화와 관련되지 않음을 밝힘.
- #338The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images
이미지 기반 추론에서 시각적 도구 사용이 실제 답변에 인과적으로 기여하는지 분석한 연구로, 정책 미조정 문제를 밝혀낸다.
- #339Specification-first convergence with an AI coding agent: a case study of dismantling a core architectural invariant across 189 files in a 717k-line codebase with no test oracle and no human code review
AI 코드 에이전트가 71만 줄 TypeScript 코드베이스에서 핵심 아키텍처 불변식을 3일 동안 2,430달러 비용으로 성공적으로 해체.