- #1Enhancing End-to-End Autonomous Driving with Latent World Model
LAW(Latent World Model)를 활용한 자기감독 학습이 nuScenes, NAVSIM, CARLA에서 최고 성능을 달성한다.
- #2Multi-Term Fourier Graph Neural Network with Sample Relationship Learning for Enhanced Remaining Useful Life Prediction
MTFGN-SRL은 RUL 예측에서 정확도와 안정성을 향상시키기 위해 다중 윈도우와 샘플 관계 학습을 결합한 새로운 그래프 신경망 프레임워크이다.
- #3ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning
ZebraLogic은 LLM의 논리적 추론 능력과 확장성을 평가하기 위한 제어 가능한 퍼즐 기반 벤치마크로, 복잡도 증가에 따른 성능 저하 현상을 밝혀낸다.
- #4OpenMoE: An Early Effort on Open Mixture-of-Experts Language Models
OpenMoE는 650M~34B 파라미터 규모의 오픈소스 MoE 언어 모델로, 라우팅 메커니즘 분석과 개선 전략 제시를 통해 MoE 연구를 촉진한다.
- #5MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding
MMBench-Video는 장시간 영상과 다양한 능력을 기반으로 LVLM의 비디오 이해력을 체계적으로 평가하는 새로운 벤치마크이다.
- #6Mixture of LoRA Experts
Mixture of LoRA Experts(MoLE)는 다중 LoRA의 유연하고 효율적인 조합을 위해 계층적 게이팅 함수를 도입한 새로운 LoRA 퓨전 기법이다.
- #7Ovis-Embedding: Pushing the Frontiers of Universal Omni-Modal Embeddings
Ovis-Embedding은 텍스트, 이미지, 영상, 오디오를 통합한 공통 임베딩 공간을 생성하는 최신 옴니모달 임베딩 모델이다.
- #8CoT-Valve: Length-Compressible Chain-of-Thought Tuning
CoT-Valve는 단일 모델로 사고 과정의 길이를 동적으로 조절하여 추론 비용을 줄이는 새로운 튜닝 전략이다.
- #9Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts
Rainbow Teaming은 LLM의 안전성을 진단하고 향상시키기 위해 품질-다양성 검색을 기반으로 한 적대적 프롬프트를 자동 생성하는 새로운 블랙박스 접근법이다.
- #10A Sanity Check for AI-generated Image Detection
AI 생성 이미지 탐지의 한계를 점검하고, 새로운 데이터셋과 모델 AIDE를 제안하여 성능을 개선한다.
- #11Do Large Language Models Latently Perform Multi-Hop Reasoning?
대규모 언어 모델(LLM)이 다중 점프 추론을 잠재적으로 수행하는지 실험적으로 분석하고, TwoHopFact 데이터셋과 내부 추론 경로를 측정하는 새로운 지표를 제안한다.
- #12Orion: A Holistic End-To-End Autonomous Driving Framework by Vision-Language Instructed Action Generation
ORION은 QT-Former, LLM, 생성형 플래너를 결합해 Bench2Drive에서 77.74 DS, 54.62% SR을 달성한 종단간 자율주행 프레임워크이다.
- #282Grounded Action Model: 3D Grounding as a Foundation for Robotics
GAM은 3D 객체 정착 기반의 새로운 로봇 기초 모델로, RoboTwin 2.0에서 55.3% 성공률을 달성한다.
- #287Embedding Physics Priors in Robot Learning: A Survey
로봇 학습에 물리학 사전지식을 통합하는 방법을 체계적으로 분류하고, 주요 응용 분야와 개방적 문제를 조망한 서베이 논문.
- #305Lean Pool: An AI-Maintained Archive of Formalized Mathematics
Lean Pool은 AI 에이전트가 관리하는 형식화 수학 아카이브 시스템이다.
- #306Realtime-Venus: A full-duplex interaction system with asynchronous delegation
Realtime-Venus는 비동기적 위임을 지원하는 프로액티브 풀-더플렉스 대화 시스템으로, 9B 규모의 두 모델을 통해 영상 및 음성 대화 성능을 개선한다.
- #307OmniEdu: Open Foundation Models for Learning and Teaching
OmniEdu는 K-12 교육과 학습을 위한 4가지 핵심 능력 기반의 오픈 소스 펀더멘탈 모델로, 27B 모델이 K12-Bench에서 63.12% EM, 76.69% F1 성능을 달성한다.
- #308GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay
GameHorizon Suite는 다양한 시간 범위와 모델 가족에서 게임플레이 능력을 평가하는 통합 데이터 및 평가 툴로, 21개 AAA 게임에서 5,000시간의 데이터를 기반으로 47개 모델을 평가한다.
- #309The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks
Taste-Bench라는 새로운 벤치마크를 제안하여 LLM 에이전트의 장기적 판단력(‘taste’)을 측정하고 훈련한다.
- #310CARE: Experience-Guided Atomic Corrective Execution for Vision-Language-Action Policies
CARE는 실패 경험을 학습하여 시각-언어-작업 정책의 회복력을 향상시키는 프레임워크로, 실제 세계에서 15.9%의 성공률 향상을 보인다.
- #311JEV-as-a-Judge: Accept When Confident, Escalate When Unsure
JEV-as-a-Judge는 저비용으로 신뢰도 높은 판단을 제공하며, 불확실한 경우에만 강력한 모델로 전달하는 방식으로 99%의 정확도를 유지한다.
- #3121% of Tokens Can Be Enough: On Gradient Estimation in On-Policy Distillation
1% 미만의 토큰으로도 성능 유지 가능: 정보 효율성 비율(IER) 기반 토큰 선택을 통한 온-정책 디스틸레이션 연구.
- #313RULER: Instance-aware Rubric Rewards for SVG Generation
RULER은 자연어 지시에 기반한 SVG 생성에서 인스턴스별 루브릭 기반 보상으로 생성 품질을 0.432 → 0.693 수준으로 향상시킨다.
- #314ACLArena: Agent Continue Learning in Multi-stage Post-training
ACLArena는 다단계 포스트 트레이닝 환경에서 에이전트의 지속 학습을 체계적으로 분석하고 개선하는 프레임워크이다.
- #315Do Synthetic Personas Predict Real Audience Response? A Sim-to-Real Study Where a No-Persona Baseline Beats Persona-Based Copy Simulation
Upworthy A/B 테스트 데이터를 기반으로, 인공 인물(persona)을 사용한 마케팅 콘텐츠 시뮬레이션은 예측 정확도가 낮아, 단순 LLM 기반 순위 매기기가 더 효과적임을 밝힘.
- #316Topological Signal Processing With Unoriented Operators
무향 토폴로지 신호 처리(UTSP)는 유향 경계 연산자를 대체해 무향 인접 행렬을 사용해 고차원 신호의 구조를 분석하고, 신호 복원 성능을 향상시킨다.
- #317Document Retrieval-Aware Chunking (D-RAC): Universal Retrieval-Aware Ingestion of Enterprise Documents via PDF Normalization and Multimodal Markdown Conversion
D-RAC은 PDF 정규화와 멀티모달 마크다운 변환을 통해 기업 문서의 효율적이고 확장 가능한 검색 최적화 청크 생성을 실현한 시스템이다.
- #318VideoGen-Agent: Reinforcing Video Generation Agents
VideoGen-Agent는 다중 작업 강화 학습을 통해 외부 도구를 활용하는 영상 생성 에이전트로, VABench 벤치마크에서 기존 모델 대비 19.1점 개선된 성능을 보인다.
- #319Recursive self-improvement of AI research agents
AIDE²는 AI 연구 에이전트가 자체 연구 효율을 반복적으로 개선하는 시스템으로, 8일간 7개의 개선을 발견하고 FML-Bench 기준 인간 설계 에이전트와 유사한 성능을 보였다.
- #320GAE: Learning a Geometry-Native Latent Space for 3D-Consistent World Generation
GAE는 3D 일관성 있는 세계 생성을 위한 기하학적 인코딩을 갖춘 압축된 잠재 공간을 학습하여 생성 및 인식 간의 공유 인터페이스를 제시한다.