- #2VLABench: A Large-Scale Benchmark for Language-Conditioned Robotics Manipulation with Long-Horizon Reasoning Tasks
VLABench는 장기적 계획과 다차원적 추론이 필요한 언어 조건화 로봇 조작을 평가하기 위한 대규모 벤치마크이다.
- #4From RAG to Memory: Non-Parametric Continual Learning for Large Language Models
HippoRAG 2는 인간 장기 기억의 동적 구조를 반영한 RAG 시스템으로, 7%의 연관 기억 성능 향상을 달성한다.
- #5Timestep Embedding Tells: It’s Time to Cache for Video Diffusion Model
TeaCache는 디퓨전 모델의 추론 속도를 4.41× 가속화하면서 시각 품질 저하를 최소화하는 훈련 없이 작동하는 캐싱 전략이다.
- #6Data Engineering for Scaling Language Models to 128K Context
LLaMA-2 기반 모델을 128K 컨텍스트 길이로 확장하기 위한 데이터 엔지니어링 전략을 제시하며, 1B~5B 토큰의 적절한 데이터 믹스로 GPT-4 128K 수준 성능을 달성한다.
- #7Caduceus: Bi-Directional Equivariant Long-Range DNA Sequence Modeling
Caduceus는 DNA 역보완성과 양방향성을 고려한 최초의 대규모 DNA 시퀀스 모델이다.
- #8Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models
Omni-MATH는 4,428개의 올림피아드 수준 문제로 구성된 LLM 수학 추론 평가 벤치마크로, 기존 모델이 60.54% 이하 정확도를 보임.
- #9PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference
PKU-SafeRLHF는 LLM 안전 정렬을 위한 대규모 안전 선호도 데이터셋으로, 19개 위험 범주와 3단계 위험 수준을 기반으로 166.8k의 선호도 데이터를 제공한다.
- #10Same Task, More Tokens: the Impact of Input Length on the Reasoning Performance of Large Language Models
LLM의 입력 길이가 증가할수록 추론 성능이 급격히 저하되며, 이는 기술적 최대치보다 훨씬 짧은 길이에서도 발생한다.
- #11DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos
DepthCrafter는 110프레임 길이의 개방세계 동영상에 대해 시간적으로 일관된 고해상도 깊이 시퀀스를 생성하는 새로운 방법이다.
- #12ImgEdit: A Unified Image Editing Dataset and Benchmark
ImgEdit은 120만 개의 편집 쌍을 포함한 고질량 이미지 편집 데이터셋과 평가 벤치마크를 제시하여 오픈소스 모델 성능을 향상시킨다.
- #208PACT: Can Enterprise AI Assistants Be Trusted Under Pressure?
PACT는 기업 AI 어시스턴트의 규정 준수를 압박 상황에서 평가하는 벤치마크로, 22개 모델의 6~10% 규칙 위반과 65% 평균 위반 증가를 보여준다.
- #305DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression
DeepSeek-V4.1-Flash는 KV 캐시 압축 기술을 통해 1M 토큰 컨텍스트를 처리하는 552B 파라미터 MoE 모델로, KV 캐시 용량을 기존 모델 대비 1/4~1/8로 줄였다.
- #308Don't Mask the Environment: Observation Supervision Changes How Agents Explore Under RL
ActObs는 환경 관측값을 예측 대상으로 포함시켜 강화학습 초기화를 개선하여 GRPO 후 탐색 성능을 향상시킨다.
- #309Can MiniMax-H3 Reason About the Physical World? An Evaluation of Omni-Modal Generative Model
MiniMax-H3의 물리적 세계 추론 능력을 다중 모달 입력 기반 평가 프레임워크로 평가한 연구.
- #310VākQA: A Benchmark and Evaluation Study for Telugu Spoken Factoid Question Answering
텔루구어 음성 기반 팩트오이드 QA 벤치마크 VākQA를 제안하고, 평가 방법과 모델 성능을 분석한다.
- #311When EOS Tokens Disagree: Understanding Length Inflation in On-Policy Distillation
OPD에서 길이 과장 문제를 유발하는 EOS 토큰 불일치를 분석하고, 이를 해결하기 위한 종단 동작 정렬 전략을 제안한다.
- #312SoL-Pi: Recursively Scaling Auto-Research Loops for Efficient Agent Harness
SoL-Pi는 자동 연구 루프를 통해 토큰 효율성을 44.7–49.0% 개선한 에이전트 헤이버스 시스템이다.
- #316An Empirical Study of Harness Design for Coding Agents
코드 생성 에이전트의 하네스 성능을 모듈별로 분석한 실험 연구.
- #319HypoEvolve: Genetic Algorithms Enable Multi-Agent LLMs to Discover Scientific Hypotheses
HypoEvolve는 과학적 가설의 질을 향상시키기 위해 유전 알고리즘을 활용한 다 에이전트 LLM 시스템이다.
- #321JEPA-Anything: Learning Predictive Models across Different Worlds
JEPA-Anything는 다양한 도메인에서 예측 모델링을 가능하게 하는 통합 프레임워크로, 정교한 인자 분해와 재사용 가능한 예측 구조를 통해 성능을 향상시킨다.
- #322VC-Attention: Value Smoothing and Softmax Casting for Low-bit Attention
VC-Attention은 비트 수를 줄인 상태에서 정확도와 속도를 동시에 향상시키는 트레이닝 없는 어텐션 기법이다.
- #323Verifiable Social Reasoning for LLM Assistants
LLM 어시스턴트의 일상적 사회적 추론 능력을 평가하기 위한 새로운 시뮬레이션 프레임워크 Fuse를 제안하고, 12개 모델을 분석하여 사용자 매개 변수의 영향을 밝혀냈다.
- #325RiskChainBench: A Benchmark for Obfuscated Platform Message Restoration and Evidence-Grounded Web Investigation
RiskChainBench는 위장된 메시지 복원과 증거 기반 웹 조사의 연계성을 평가하는 새로운 벤치마크로, 3,600개의 토큰-텍스트 입력과 600개의 로컬 웹 환경을 제공한다.
- #326RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning
RetireOPD는 강화학습 기반 에이전트에 기술 정보를 내재화하는 자가 퇴역형 온-폴리시 디스틸레이션 방법으로, ALFWorld와 WebShop에서 성능을 11.8%~18.8% 개선한다.
- #327Reflect, Revise, Reuse: Training-Free Skill Evolution for GUI Agents
EvoSkill-GUI는 GUI 에이전트의 실행 피드백을 기반으로 훈련 없이 스킬을 수정하는 반복 루프를 통해 성능을 향상시킨다.
- #328Self-Evolving Search Index
SELF-INDEX는 인덱스 키를 자동 진단·수정·검증하는 프레임워크로, 다양한 검색 환경에서 검색 성능을 지속적으로 향상시킨다.
- #329WeVisDoc: From Coverage to Capability for Robust End-to-End Document Parsing
WeVisDoc은 두 단계의 데이터 중심 프레임워크로, 다양한 문서 파싱 성능을 95.38 (OmniDocBench v1.6)까지 향상시킨다.
- #330Video DeltaNet: A Video-Native Hybrid Attention for Livestream Video Generation
Video DeltaNet(VDN)은 영상 생성 속도를 14.5× 향상시키는 하이브리드 어텐션 구조를 제안한다.
- #331A Zeroth-Order Paradigm for LLM Preference Alignment
ComPO는 비교 오라클 기반의 제로차 수식 선호 정렬 방법으로, 소량의 가능성 차이를 가진 선호 쌍을 활용해 모델 정렬 성능을 향상시킨다.
- #332Gaze as Evidence for Common Grounding: A Cross-Corpus Analysis of MapTask and MUNDEX
지도자 역할 수행자의 시선 행동이 협업 과제에서 의미 정착을 반영한다는 것을 두 대규모 대화 코퍼스에서 분석적으로 입증했다.