- #2Iris: Climbing to the Search Frontier
Iris-mini와 Iris-pro는 35B-A3B와 397B-A17B 규모로 학습된 검색 에이전트로, SFT-RL climbing을 통해 강력한 성능을 달성했다.
- #3Magma: A Foundation Model for Multimodal AI Agents
Magma는 UI 탐색과 로봇 조작 등 다양한 환경에서 작동하는 멀티모달 에이전트 기반 모델로, SoM과 ToM을 통해 공간-시간적 지능을 획기적으로 향상시킨다.
- #4Scaling Proprioceptive-Visual Learning with Heterogeneous Pre-trained Transformers
HPT는 이질적인 로봇 데이터를 기반으로 정책을 사전 학습하여 20% 이상의 미见过 태스크 성능 향상을 달성한다.
- #6SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution
SWE-RL은 소프트웨어 진화 데이터와 규칙 기반 보상으로 LLM의 추론 능력을 향상시키는 새로운 강화 학습 접근법이다.
- #7R-Judge: Benchmarking Safety Risk Awareness for LLM Agents
R-Judge는 LLM 에이전트의 안전성 판단 능력을 평가하는 벤치마크로, GPT-4o가 74.45%의 F1 점수를 기록했으며, 미세조정이 성능 향상에 효과적임을 밝힘.
- #8AIR-Bench: Benchmarking Large Audio-Language Models via Generative Comprehension
AIR-Bench는 대규모 오디오-언어 모델의 생성적 이해 능력을 평가하는 첫 번째 벤치마크로, 19개의 기초 태스크와 2,000개의 개방형 질문을 포함한다.
- #9Global Structure-from-Motion Revisited
GLOMAP은 전역 Structure-from-Motion 문제를 해결하는 새로운 시스템으로, COLMAP과 유사한 정확도를 유지하면서 수십 배 빠른 처리 속도를 제공한다.
- #10Chain of Agents: Large Language Models Collaborating on Long-Context Tasks
Chain-of-Agents(CoA)는 여러 대형 언어 모델이 협력하여 긴 문맥 작업을 처리하는 새로운 프레임워크로, 최대 10%의 성능 향상을 보인다.
- #11Spider 2.0: Evaluating Language Models on Real-World Enterprise Text-to-SQL Workflows
Spider 2.0은 632개의 실제 기업 데이터베이스 워크플로우를 기반으로, 기존 텍스트-투-SQL 벤치마크보다 훨씬 복잡한 SQL 생성과 다이얼렉트 이해를 요구하는 새로운 평가 프레임워크이다.
- #12ProcessBench: Identifying Process Errors in Mathematical Reasoning
ProcessBench는 수학적 추론 과정에서 오류를 식별하는 능력을 평가하는 대규모 벤치마크로, 3,400개의 경시대회 수준 문제를 포함한다.
- #13mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding
DocOwl 1.5는 OCR-free 환경에서 10개의 문서 이해 벤치마크에서 기존 MLLM 대비 최대 10점 이상 성능 향상.
- #306MaxKernel: Agentic Kernel Generation for TPUs
MaxKernel은 TPU 커널 최적화를 위한 3가지 에이전트 패러다임을 갖춘 시스템으로, JAXBench에서 1.58× 평균 가속을 달성한다.
- #308Bilevel Coordinated Reflection: A Game-Theoretic Approach to Multi-Agent LLM Systems
다중 에이전트 LLM 시스템에서 SRMA 알고리즘을 도입하여 반영 과정을 게임 이론적 구조로 모델링하고, 72.2%의 SWE-bench 성능 달성.
- #311UniMate: One Unified Model to Animate Diverse Skeletons
UniMate는 다양한 스켈레톤에 텍스트 프롬프트만으로 움직임을 생성하는 통합 기반 모델로, 테스트 시 최적화 없이도 Zero-shot 전이를 지원한다.
- #312Spectral-Target Physical Latent Structuring for JEPA-Style World Models
JEPA 기반 월드 모델에서 물리적 정보를 효과적으로 인코딩하기 위해 Fourier auxiliary head를 도입하여 planning 성능과 데이터 효율성을 향상시킨다.
- #314Motion-Omni: End-to-End Joint Speech and Full-Body Motion for Spoken Dialogue
Motion-Omni는 대화 중 말과 동작을 동시에 생성하는 엔드투엔드 프레임워크로, 말과 몸짓을 동일한 상태에서 생성하여 실시간 성능과 정확도를 동시에 향상시킨다.
- #318When Quantization Breaks Memory: Recurrent-State Write-Back in Low-Precision Temporal Inference
저정밀 재귀 추론에서 상태 저장 방식인 recurrent-state write-back이 추론 성능에 70~300배의 오차 증가를 유발한다는 것을 실험적으로 밝힘.
- #320DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training
DRACO는 GRPO 내에서 동적 루브릭을 생성하고 이를 기반으로 단계별 보상을 할당하여, AppWorld에서 기존 방법 대비 15.9점 개선된 성능을 달성한 신규 신용 할당 방법이다.
- #322WorldReward: Reward Modeling for Camera-Conditioned World Models
WorldReward는 카메라 조건에 따른 월드 모델의 행동 일관성과 시각 품질을 통합 평가하는 VLM 기반 이진 선호 보상 모델이다.
- #323The Attention Triangle in Audio-Video Models
음성-비디오 디퓨전 모델에서 주의 메커니즘의 삼각 구조를 분석하고, 이를 기반으로 의미 누수를 진단 및 완화하는 방법을 제시한다.
- #324PACE: Towards Surfacing Hidden Conflicts in User Requests
PACE 데이터셋과 PaceMaker 다중 에이전트 프레임워크를 제안하여 사용자 요청의 은밀한 충돌을 식별하는 성능을 향상시킨다.
- #325WorldSculpt: Generating Compositional Worlds from Grounded Videos
WorldSculpt는 Pixal3D를 다중 뷰 조건화 경로로 확장하여 밀집된 장면에서도 개별 객체 메시를 생성하는 3D 합성 프레임워크이다.
- #326Using Grounded Theory for Agent Behavior Analysis at Scale
AutoTraceGT는 대규모 에이전트 트레이잭토리 분석을 위한 첫 번째 자동화된 Grounded Theory 파이프라인으로, 7,500개 이상의 데이터에서 73-91%의 실패 원인을 복구한다.
- #327FlashRender: Few-Step Generative Rendering via Camera-Controlled Video MeanFlow
FlashRender는 RETA, MeanFlow, on-policy flow map distillation을 통해 25배 적은 샘플링 비용으로 높은 품질의 카메라 제어 동영상 재렌더링을 실현한 few-step generative rendering 모델이다.
- #328AdaptVPR: Route-Aware Hard Positive Generation for Robust Visual Place Recognition
AdaptVPR은 도메인 변화에 강한 VPR 학습을 위해 경로 기반 생성 증강 프레임워크를 제안하며, AdaptCities 데이터셋을 통해 R@1 최대 9.2% 개선을 달성한다.
- #329ShallowStream: Index Shallow then Answer Deep for Streaming Video Understanding
ShallowStream은 MLLM의 얕은 계층을 활용해 실시간 동영상 처리 비용을 52.1배 감소시키는 새로운 스트리밍 비디오 이해 프레임워크이다.
- #330Enoki: Efficient Multi-Level Hallucination Detection
Enoki는 OpenIE 기반 다중 수준 hallucination 탐지 프레임워크로, claim-level 검증과 span-level 로컬라이제이션을 공유된 표현으로 통합하여 효율성을 높인다.
- #331Ask Before You Optimize: Dynamic Pre-Formulation Clarification for Interactive Optimization
InterOPT은 OR-Clarify 벤치마크를 통해 미완전한 최적화 문제 설명에서 필요한 정보를 선택적으로 명확히 하며, 모델링 전 준비 여부를 판단하는 시스템이다.
- #332Select, Compress, Reinvest: A Controlled Study of Visual-Token Allocation in Long-Video MLLMs
1시간 길이 동영상에서 8개의 적절히 선택된 프레임이 16개의 균일하게 선택된 프레임보다 6.9점 높은 성능을 보인다.
- #333QCell: Recombining and Aligning Cell Queries for Overlapping Instance Segmentation
QCell은 반투명 세포의 겹침 구분을 위해 인스턴스 재조합 모듈과 대비 학습을 결합한 쿼리 기반 세포 인스턴스 분할 모델이다.