- #1SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation
SemComp-Bench는 생성된 동영상이 지시된 결과를 달성하면서 참조 이미지와 의미적 연관성을 유지하는 능력을 평가하는 새로운 벤치마크 프로토콜이다.
- #2Reconstruction vs. Generation: Taming Optimization Dilemma in Latent Diffusion Models
VA-VAE와 LightningDiT를 결합한 시스템이 ImageNet 256 생성에서 FID 1.35 달성하며 21.8× 빠른 수렴 속도를 보인다.
- #3QuIP#: Even Better LLM Quantization with Hadamard Incoherence and Lattice Codebooks
QuIP#는 2~4비트에서 최고 성능을 보이는 가중치 전용 양자화 방법으로, 하드웨어 효율적인 E8 격자 코드북과 랜덤 하다마드 변환을 결합한다.
- #4AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agents
AndroidWorld는 20개의 실제 Android 앱에서 116개의 프로그래밍 작업을 테스트하는 동적 벤치마크 환경이다.
- #5InternVideo2: Scaling Foundation Models for Multimodal Video Understanding
InternVideo2는 6B 파라미터 규모의 멀티모달 영상 이해 모델로, 마스킹된 영상 복원, 크로스모달 대비 학습, 토큰 예측을 통합한 3단계 학습 방식을 채택한다.
- #6Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models
Prismatic VLMs는 VLM 설계 공간을 체계적으로 탐구하고, 7-13B 규모의 모델이 InstructBLIP과 LLaVa v1.5를 엄격히 초과하는 성능을 보인다.
- #7Hybrid LLM: Cost-Efficient and Quality-Aware Query Routing
Hybrid LLM은 LLM과 소형 모델의 장점을 결합한 쿼리 라우팅 방식으로, 40%까지 대형 모델 호출을 줄이며 품질 저하 없이 비용 효율성을 확보한다.
- #8Group-in-Group Policy Optimization for LLM Agent Training
GiGPO는 LLM 에이전트의 다단계 학습에서 정밀한 크레딧 할당을 가능하게 하는 새로운 그룹 기반 강화 학습 알고리즘이다.
- #9SpatialRGPT: Grounded Spatial Reasoning in Vision Language Model
SpatialRGPT는 3D 공간 인식 능력을 갖춘 VLM을 구현하기 위해 지역 정보와 깊이 정보를 통합한 새로운 모델이다.
- #10LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens
LongRoPE는 2048k 토큰의 컨텍스트 윈도우를 구현하면서 기존 성능을 유지하는 LLM 확장 기법이다.
- #11VideoAgent: Long-form Video Understanding with Large Language Model as Agent
VideoAgent는 대형 언어 모델을 에이전트로 활용해 장시간 동영상 이해를 효율적으로 수행하는 시스템이다.
- #168SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation
SemaPLC는 PLC 코드 생성 시 프로젝트 기반 및 검증 기반의 에이전트 허네스를 제시하여 실행 시 정확도를 52.2% 달성한다.
- #294SoftVTBench: A Deformation-Aware Visuo-Tactile Dataset and Benchmark for Deformable-Object Manipulation
SoftVTBench는 변형 가능 물체 조작의 물리적 상호작용을 평가하는 데 사용되는 시각-촉각 데이터셋 및 벤치마크로, 4,000개의 전문가 시연과 20Hz 동기화 데이터를 포함한다.
- #295Looped Language Models Improve Compositional Tool Calling
반복형 언어 모델은 복합적인 API 호출 작업에서 성능 향상을 보인다.
- #306Demystifying Agent Skills: Why They Work-Until They Don't
LLM 에이전트의 스킬 활용 메커니즘을 체계적으로 분석하여, 언제 작동하고 왜 실패하는지 밝힌 연구.
- #307Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence
Zetta는 실시간 실행 중 코드 기반 크리틱과 복구 기술을 진화시키며, 90.8% 성공률을 달성한 클로즈드-루프 에마바디드 허네스이다.
- #308ASI-Bench: At the Dawn of Artificial Superintelligence
ASI-Bench는 AI가 인간 지침 없이 독자적으로 과학 연구를 수행할 수 있는 능력을 평가하는 첫 번째 벤치마크로, 18개 최신 에이전트-모델 설정에서 평균 점수가 50.91에서 26.62로 급락함을 보여준다.
- #310Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL
Co-RL은 다중 에이전트 강화학습을 통해 라벨 없이도 언어 및 비주얼-언어 모델의 추론 성능을 향상시키는 프레임워크이다.
- #311FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution
FreeToken은 35B부터 753B 파라미터 규모의 MoE 모델을 개인 기기에서 효율적으로 실행하는 엣지 네이티브 서빙 시스템이다.
- #312Energy-Guided Flow Matching
Energy-Guided Flow Matching(EG-FM)는 고주파 정보를 점진적으로 복원하는 생성 경로를 도입하여 FID 1.45를 달성한 픽셀 공간 생성 모델이다.
- #313Optimized Fuzzy Logic Approach with the IEEE Key Gas Method for Diagnosing Power Transformer Faults Using Dissolved Gas Analysis
FL-KGM 모델이 변압기 고장 진단 정확도를 98.6%까지 향상시킨다.
- #314Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation
TAMP-Nav는 2D VLM 사전 학습과 3D 실행 간의 불일치를 해결하며, 효율적인 탐색을 위한 통합 프레임워크로 R2R-CE에서 66.2%의 SR 성능을 달성한다.
- #315SPADE: Self-Play in Adaptive Synthetic Executable Environments
SPADE는 LLM이 스스로 학습 환경을 생성하며 자기 개선하는 자가 경기 강화 학습 프레임워크로, 30B 파라미터 모델에서 기존 베이스라인 대비 평균 +5.3개선.
- #316From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents
RUPA는 LLM 에이전트의 실행 트래잭토리에 기반한 관계 기반 불확실성 전파를 통해 신뢰도 높은 UQ를 구현한다.
- #317Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis
C3LM 모델을 Top-K 프롬프팅과 ChemCensor 기반 보상으로 훈련하여 URSA-expert-2026 벤치마크에서 최고 성능을 달성했다.
- #318V-RAE: Rethinking Video Latent Spaces for Generation
V-RAE는 동결된 시각 기초 모델의 잠재 공간을 기반으로 동영상 생성을 위한 새로운 잠재 공간 구조를 제안하며, K600에서 2.13 rFVD를 달성한다.
- #319Agent Lightning v1.0: Towards Harnessed Agentic RL
Agent Lightning v1.0은 3,500줄의 코드로 구현된, 임의의 agent harness와 호환 가능한 harnessed agentic RL 프레임워크로, SWE-bench Verified에서 Qwen3.5-9B의 성능을 41.8%에서 56.4%로 14.6%p 향상시킨다.
- #320Unifying Graph Neural Networks Through a Common Layer Equation
그래프 신경망을 일관된 계층 방정식으로 통합하여 200개 이상의 아키텍처를 공통 설계 공간에 정리한다.
- #321EDITBRIDGE: Towards Faithful and Efficient Ultra-High-Resolution Image Editing
EditBridge는 초고해상도 이미지 편집에서 정보 분산과 텍스처 저하 문제를 해결하며 4K 편집을 61초 내 수행하는 확률적 다리 기반 프레임워크이다.
- #322LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents
LEGO-RL은 기존 코드 에이전트 허네스를 수정하지 않고 정책 기울기 최적화를 연결하는 프레임워크로, SWE-bench Verified에서 6~9% 성능 향상을 달성했다.