- #1PhiZero: A World Model Built Around Physical Language
PhiZero는 물리적 세계의 진화를 추론-렌더링 방식으로 모델링하는, 물리적 언어 기반의 월드 모델이다.
- #2VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System
VideoCoCo는 실행 가능한 코드를 이용해 물리적으로 일관된 동영상을 생성하는 이중 엔진 시스템을 제안한다.
- #3Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations
VPP는 VDM 내 예측적 시각 표현을 활용해 로봇 정책 성능을 18.6~28.8% 개선한 일반적 정책이다.
- #4LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code
LiveCodeBench는 코드 생성 외에도 디버깅, 실행, 테스트 예측을 포함한 코드 관련 능력을 종합적으로 평가하는, 오염 없는 대규모 언어 모델 평가 벤치마크이다.
- #5LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models
LlamaFactory는 100개 이상의 언어 모델을 코드 없이 맞춤형으로 미세 조정할 수 있는 통합 프레임워크로, 다양한 효율적 학습 기법을 지원한다.
- #6Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality
Transformer와 SSM은 구조적 상태 공간 이중성으로 연결될 수 있다.
- #7M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation
M3-Embedding은 다국어, 다기능, 다단위를 지원하는 최초의 텍스트 임베딩 모델로, 자기 지식 증류와 최적화된 배치 전략을 통해 다양한 검색 성능을 달성한다.
- #8VGGT: Visual Geometry Grounded Transformer
VGGT는 3D 장면 속 카메라 파라미터, 포인트 맵, 깊이 맵 등을 단일 패스로 추정하는 트랜스포머 기반 신경망이다.
- #9SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering
SWE-agent는 LM 에이전트가 소프트웨어 엔지니어링 작업을 자동화하도록 돕는 ACI 시스템이다.
- #10Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
Video-MME는 비디오 분석에서 MLLM의 다중 모달 성능을 평가하는 최초의 종합적 벤치마크로, 900개의 영상과 2,700개의 QA 쌍으로 구성되어 있다.
- #11Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference
Chatbot Arena는 240K 이상의 사용자 투표를 바탕으로 LLM을 인간 선호도 기반으로 평가하는 오픈 플랫폼이다.
- #12s1: Simple test-time scaling
s1-32B 모델은 1,000개의 s1K 데이터셋과 budget forcing 기법을 통해 o1-preview를 27% 초과하는 수학 문제 해결 성능을 달성했다.
- #19EvoPINN: Agentic Discovery of Executable Algorithms for Physics-Informed Neural Networks
EvoPINN은 LLM 기반 에이전트를 활용해 PDE 특화 학습 알고리즘을 자동으로 발견하는 실행 기반 프레임워크로, SLRC-PINN 아키텍처를 독자적으로 개발해 기존 방법 대비 L2 오차를 감소시킨다.
- #20Recursive transformers for semiconductor thermo-mechanical reliability
반도체 열기계 신뢰성 분석을 위한 재귀 트랜스포머 모델의 성능과 효율성을 비교 평가한 연구.
- #29MPIE-Bench: Benchmarking Anatomically Plausible Multi-Person Interaction Editing
MPIE-Bench는 다인물 상호작용 편집의 해부학적 일관성을 평가하기 위한 2,500개 샘플의 벤치마크와 MPIE-Eval이라는 새로운 평가 프로토콜을 제안한다.
- #38Σ-Mem: An Online Reliability Memory for LLM-based Multi-Agent Systems
Σ-Mem은 LLM 기반 다중 에이전트 시스템에서 신뢰도를 기반으로 동적으로 조정하는 온라인 메모리 시스템이다.
- #85ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine
ACE-Data-0은 실내 환경에서 사람-객체 상호작용을 다중 센서로 동기화 기록한 대규모 데이터셋이다.
- #308OVEarth-Bench: Evaluating Category Breadth and Query Diversity for Open-Vocabulary Earth Observation
OVEarth-Bench는 지구 관측 이미지에서 개방형 어휘와 다양한 질의 유형을 평가하는 새로운 벤치마크로, MLLM 기반 모델이 가장 우수한 성능을 보인다.
- #309CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition
CLBench-V는 다중 모달 컨텍스트 학습을 평가하기 위한 벤치마크로, 3,443개 인스턴스에서 최고 점수 0.2847를 기록하며 모델의 한계를 드러낸다.
- #310Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents
Qwen-UI-Agent는 실제 모바일 기기와 크로스 플랫폼 환경에서 뛰어난 성능을 보이는 GUI 에이전트로, 92.2%의 MobileWorld-Real 정확도를 달성했다.
- #311Metis: Memory Foundation Model
Metis는 기존의 외부 메모리 모듈을 대체하는 첫 번째 내재 메모리 기반 모델로, 메모리 상태와 절차를 모델 내부에 통합하여 효율적이고 유연한 메모리 처리를 가능하게 한다.
- #312AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis
AskChem은 문서 중심 검색 대신, 과학적 주장(claim)을 중심으로 화학 문헌을 통합하는 인프라를 제시한다.
- #313Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering
Frontis-MA1은 MLE 분야에서 재귀적 자기 개선을 위한 AI4AI 모델로, OpenMLE 스택과 연계해 Medal Average 60.61%를 달성한다.
- #314ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow
ShadowDancer는 동영상과 그림자 쌍을 통해 동작을 학습하여 다양한 동역학에 대한 프레임 수준의 정밀 제어를 가능하게 하는 새로운 인터페이스를 제시한다.
- #315StatePlay: State-Aware Game World Models for Mechanics-Consistent Generation
StatePlay는 게임 내부 상태를 예측하여 기계적 일관성을 유지하는 첫 번째 상태 인식 게임 월드 모델이다.
- #316DistillAlign: Coordinating Mode Covering and Mode Seeking in Autoregressive Video Distillation
DistillAlign은 DMD와 CD를 결합하여 초기화와 최종 정제 단계의 분포 일치를 동시에 달성하는 비디오 디스틸레이션 방법이다.
- #317CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization
CoRT는 토큰 수준의 크레딧 할당을 위해 카운터패클 레플레이를 활용한 GRPO 개선 방법으로, 평균 4.4%포인트 성능 향상을 보인다.
- #318ICLE++: Modeling Fine-Grained Traits for Holistic Essay Scoring
ICLE++는 다중 특성 평가를 위한 새로운 어조화 에세이 점수 데이터셋이다.
- #319Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory
Memory Decoder at Scale는 6.9B 파라미터 규모로 확장된 장기 기억 모듈을 제안하여 언어 모델 성능을 파라미터 효율적으로 향상시킨다.
- #320Beacon: Knowing When and How to Perform Agentic Visual Reasoning
Beacon은 도구 사용의 적절성과 효과성을 동시에 향상시킨 새로운 에이전트형 시각 추론 모델로, 강화 학습 기반의 Necessity-Aware Adaptive Reward와 Hint-Guided Capability Expansion을 핵심으로 한다.