- #1Large Discovery Models: Empirically-grounded Model-Based Open-Ended Search
LDM은 생성 모델과 베이지안 비모수 보상 서로게 모델을 결합한, 개방적 가설 공간에서의 효율적 탐색 엔진이다.
- #2ASI-Bench: At the Dawn of Artificial Superintelligence
ASI-Bench는 AI가 인간 지침 없이 독자적으로 과학 연구를 수행할 수 있는 능력을 평가하는 첫 번째 벤치마크로, 18개 최신 에이전트-모델 설정에서 평균 점수가 50.91에서 26.62로 급락함을 보여준다.
- #3AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge Bases
AgentPoison는 RAG 기반 LLM 에이전트의 메모리나 지식베이스를 중독하여 공격하는 최초의 백도어 공격 방법이다.
- #4LightRAG: Simple and Fast Retrieval-Augmented Generation
LightRAG는 그래프 기반 인덱싱과 이중 수준 검색을 결합하여 RAG 시스템의 정확도와 효율성을 향상시킨다.
- #5Aya Model: An Instruction Finetuned Open-Access Multilingual Language Model
Aya는 101개 언어(51개는 저자원 언어)에서 지시사항을 따르는 오픈소스 멀티링구 모델로, mT0와 BLOOMZ보다 대부분의 작업에서 성능이 우수하다.
- #6Gated Delta Networks: Improving Mamba2 with Delta Rule
Gated DeltaNet은 Mamba2와 DeltaNet의 장점을 결합한 새로운 메모리 관리 메커니즘으로, 다양한 벤치마크에서 성능을 개선한다.
- #7ShortGPT: Layers in Large Language Models are More Redundant Than You Expect
ShortGPT는 블록 영향(BI) 기반의 단순한 레이어 제거를 통해 LLM의 25% 파라미터 감소와 95% 성능 유지 가능성을 입증한 연구이다.
- #8What matters when building vision-language models?
Idefics2라는 80억 파라미터의 효율적 VLM을 개발하여 다양한 벤치마크에서 기존 모델 4배 크기와 유사한 성능을 달성했다.
- #9LLaVA-Prumerge: Adaptive Token Reduction for Efficient Large Multimodal Models
LLaVA-Prumerge는 시각 토큰 수를 4~14배 줄이며 성능 유지하는 적응형 토큰 축소 전략을 제안한다.
- #10Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents
UGround는 시각 기반 GUI 에이전트를 위한 강력한 보편적 시각 정착 모델로, 10M GUI 요소를 포함한 대규모 데이터셋으로 학습되어 기존 모델 대비 최대 20% 개선된 성능을 보인다.
- #11Fast3R: Towards 3D Reconstruction of 1000+ Images in One Forward Pass
Fast3R은 1,000개 이상의 이미지를 단일 순방향 패스로 처리하는 Transformer 기반 3D 재구성 모델로, DUSt3R 대비 14배 오류 감소와 250 FPS 이상의 추론 속도를 달성한다.
- #12SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference
SparseVLM은 텍스트 유도적 토큰 최적화를 통해 VLM의 추론 효율성을 향상시키는 훈련 없이 작동하는 메커니즘이다.
- #300DiSCO: Defending text-to-image generation through distribution-guided contrastive prompt optimization
DiSCO는 텍스트-이미지 생성 모델의 안전성을 향상시키는 블랙박스 방식의 프롬프트 최적화 모듈로, ASR을 23.6%에서 2.4%까지 감소시킨다.
- #304StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling
StateM은 실행 시스템의 확장으로 GPT-5.6 기반 에이전트의 Terminal-Bench 정확도를 95.3%까지 끌어올렸다.
- #306Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization
SA-MRPO는 다중 보상 최적화에서 포화 상태에 따라 보상 가중치를 동적으로 재조정하여 학습 효율을 향상시킨다.
- #307Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements
Agentic ESOpt는 GPU 메모리 소요가 적은 진화 전략 기반의 대형 언어 모델 최적화 프레임워크로, WebArena-Lite에서 Qwen3.5-27B 모델을 기반으로 No Skill 기준 대비 6.69% 개선.
- #308Demystifying Agent Skills: Why They Work-Until They Don't
LLM 에이전트의 스킬 활용 메커니즘을 체계적으로 분석하여, 언제 작동하고 왜 실패하는지 밝힌 연구.
- #309Early Cycle Charge Trajectory Generative Prediction and Full Life Cycle Health Management of Iron-Chromium Flow Batteries Based on FlowBD-E1
FlowBD-E1은 철-크롬 흐름전지의 초기 사이클 데이터만으로 전체 충전 전압/전류 궤적을 0.731% 이하의 오차로 예측하는 생성 모델이다.
- #310PROBE: Manipulation-Grounded Visual Question Answering with VLM Agents
PROBE는 물리적 상호작용이 필요한 질문에 대답하는 VLM 에이전트를 평가하고 미세조정하는 프레임워크로, PROBE-Sim 시뮬레이터와 PROBE-Bench 벤치마크, PROBE-Agent 미세조정 레시피를 제시한다.
- #311Energy-Guided Flow Matching
Energy-Guided Flow Matching(EG-FM)는 고주파 정보를 점진적으로 복원하는 생성 경로를 도입하여 FID 1.45를 달성한 픽셀 공간 생성 모델이다.
- #312Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation
TAMP-Nav는 2D VLM 사전 학습과 3D 실행 간의 불일치를 해결하며, 효율적인 탐색을 위한 통합 프레임워크로 R2R-CE에서 66.2%의 SR 성능을 달성한다.
- #313MOSS-VL Technical Report
MOSS-VL은 실시간 영상-언어 상호작용을 핵심 기능으로 설계된 오픈 소스 모델로, 11.3B 파라미터와 게이티드 크로스-어텐션을 통해 OmniMMI Proactive Alerting에서 66.0 점을 달성했다.
- #314FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution
FreeToken은 35B부터 753B 파라미터 규모의 MoE 모델을 개인 기기에서 효율적으로 실행하는 엣지 네이티브 서빙 시스템이다.
- #315From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents
RUPA는 LLM 에이전트의 실행 트래잭토리에 기반한 관계 기반 불확실성 전파를 통해 신뢰도 높은 UQ를 구현한다.
- #316Cross-Model Memory Transfer via Target-Side Reader Adaptation
Engram 스타일 해시 메모리를 타겟 모델에 전달할 때, 메모리 자체보다는 타겟 측 리더의 설계가 성능에 더 큰 영향을 미친다는 것을 실험적으로 입증했다.
- #317How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks
AI 연구 에이전트의 실패 원인을 진단하기 위한 100개 과제와 45개 실패 패턴을 제시하는 AutoResearchEval과 ARFT를 소개한다.
- #318Advancing Open and Reproducible Relational Learning: RelArena-α, TabPFN-Rel and RPI
Prior Labs는 RelArena-α, TabPFN-Rel, RPI를 오픈소스로 발표하며 관계 학습 연구의 재현성과 비교성을 강화한다.
- #319EDITBRIDGE: Towards Faithful and Efficient Ultra-High-Resolution Image Editing
EditBridge는 초고해상도 이미지 편집에서 정보 분산과 텍스처 저하 문제를 해결하며 4K 편집을 61초 내 수행하는 확률적 다리 기반 프레임워크이다.
- #320HarmProfile: Characterizing Harmful Distributions in Frontier LLMs
HarmProfile은 23개 프런티어 LLM의 해로운 출력을 분석하여 모델별 위험 프로필을 정의한 대규모 벤치마크 데이터셋이다.
- #321DumpsterCluster: From Dumpster Diving to Serving LLaMA-70B on $60 GPUs
128개의 중고 V100 GPU로 구성된 DumpsterCluster를 통해 LLaMA-70B 추론을 $22K에 구현하며, 에너지 및 탄소 조건에 따라 경제적·환경적 이점을 분석.