- #1WorldMind: Decoupled Game World Model for State-Aware NPC Behavior
WorldMind는 게임 내 NPC 행동을 게임 상태에 기반한 명시적 결정으로 구현한 최초의 분리형 게임 월드 모델이다.
- #2ToolACE: Winning the Points of LLM Function Calling
ToolACE는 26,507개의 다양한 API를 기반으로 생성된 정확하고 복잡한 툴 학습 데이터를 통해 8B 파라미터 모델이 GPT-4 수준의 성능을 달성한 자동 생성 파이프라인입니다.
- #3Bridging Language and Items for Retrieval and Recommendation: Benchmarking LLMs as Semantic Encoders
BLaIR은 대규모 Amazon Reviews 2023 데이터셋을 기반으로 훈련된 언어-아이템 연관성을 학습하는 추천 시스템용 임베딩 모델로, 복잡한 자연어 문맥에서의 상품 검색 성능을 개선한다.
- #4CodeAgent: Enhancing Code Generation with Tool-Integrated Agent Systems for Real-World Repo-level Coding Challenges
CodeAgent는 외부 도구를 통합한 LLM 기반 에이전트 프레임워크로, 실무 레포지토리 수준의 코드 생성 성능을 최대 250%까지 향상시킨다.
- #5PixArt-Σ: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation
PixArt-Σ는 4K 해상도 이미지를 생성하는 Diffusion Transformer 모델로, 훈련 효율성과 고해상도 생성 능력을 동시에 달성한 모델이다.
- #6Better & Faster Large Language Models via Multi-token Prediction
다중 토큰 예측을 통해 13B 모델이 HumanEval에서 12%, MBPP에서 17% 더 많은 문제를 해결하는 LLM 훈련 방법을 제안한다.
- #7rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking
rStar-Math는 MCTS와 자체 진화를 통해 소형 언어 모델의 수학 추론 성능을 OpenAI o1 수준으로 끌어올리는 시스템 2 스타일 접근법이다.
- #8To CoT or not to CoT? Chain-of-thought helps mainly on math and symbolic reasoning
CoT는 수학 및 기호적 추론 태스크에서 성능 향상에 효과적이지만, 다른 태스크에서는 제한적이다.
- #9OminiControl: Minimal and Universal Control for Diffusion Transformer
OminiControl은 DiT 기반 이미지 생성 모델에 최소한의 파라미터 추가로 유연한 이미지 조건 처리를 가능하게 하는 통합 프레임워크이다.
- #10Break the Sequential Dependency of LLM Inference Using Lookahead Decoding
Lookahead Decoding은 보조 모델 없이 LLM 추론 속도를 1.8x~4x까지 향상시키는 정확한 병렬 디코딩 알고리즘이다.
- #11R1-VL: Learning to Reason with Multimodal Large Language Models via Step-Wise Group Relative Policy Optimization
R1-VL은 StepGRPO를 통해 MLLM의 단계별 추론 능력을 향상시킨 모델로, StepRAR과 StepRVR을 도입해 희소 보상 문제를 해결한다.
- #69PhysCaP: Grounding Code-as-Policy Agent with Physics-Informed Exploration
PhysCaP는 물리 정보 기반 탐색을 도입한 Code-as-Policy 에이전트로, 물체의 질량과 강성 추정을 통해 효율적인 로봇 조작을 가능하게 한다.
- #107Towards a Densing Law for User Representation Learning at Billion-Scale Capacity
유저 행동 데이터의 밀도 기반 토큰화 법칙(User Behavioral Densing Law)을 제안하고, ALGN이라는 적응형 토큰화 방법으로 대규모 유저 표현 학습 성능을 향상시킨다.
- #291ReWorld: An Interactive World Model with Long-Horizon Memory
ReWorld는 장기 기억과 실시간 제어를 결합한 인터랙티브 월드 모델로, 704×1280 해상도 영상 스트리밍과 11.95° 회전 오차를 기록했다.
- #299EchoWM: Open and Enterable Omnimodal World Models
EchoWM은 720p 영상, 환경음, 음악, 음성을 동시 생성하며, 1인칭 및 3인칭 시점의 연속 이동에 반응하는 옴니모달 월드 모델이다.
- #305Retrieval-grounded robot program generation and simulation-based correction via Model Context Protocol
ABB RAPID 프로그램을 자연어에서 생성하고 RobotStudio 시뮬레이션을 통해 검증하는 RAG-MCP 통합 워크플로우를 제안한다.
- #306Composable Trust Infrastructure for Manufacturing Knowledge Graphs: Cross-System Provenance, Temporal Reasoning, and Decision Traceability
제조 지식 그래프에 SHACL, PROV-O, bi-temporal 버전 관리, 결정 객체를 통합한 신뢰 인프라를 제안한다.
- #308One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows
Thinkingbox는 상태 기반 비즈니스 워크플로우에서 에이전트의 신뢰성 평가를 위한 샌드박스와 벤치마크를 제시한다.
- #309Tomatoes, Potatoes, and Onions: Questioning the Need for Faces in Face Presentation Attack Detection
토마토, 감자, 마늘을 사용한 무표현 얼굴 PAD 데이터셋 TPO를 통해 얼굴 정보 없이도 높은 성능의 PAD가 가능함을 실증.
- #310MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World Tasks
MobilePA-Bench는 모바일 환경에서 LLM 에이전트의 도구 사용 및 계획 능력을 종합적으로 평가하는 대규모 벤치마크이다.
- #311Apodex 1.1: Scaling Agentic Intelligence for Complex Work
Apodex 1.1은 복잡한 작업을 지속적으로 처리하는 에이전트 지능을 확장한 시스템으로, Environment Scaling과 Agentic Coordination Scaling을 통해 성능을 높인다.
- #312Industrial-Instruction: An End-to-End Framework for Building Instruction-Tuning and Benchmark Datasets from Industrial Technical Reports
Industrial-Instruction은 산업 기술 보고서를 기반으로 QA 데이터셋과 생성 파이프라인을 제공하여 산업 벤치마크 및 훈련 데이터를 구축하는 실용적이고 재현 가능한 방법을 제시한다.
- #313TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming
TLive-Omni는 전자상거래 라이브 스트리밍에서 오디오, 비디오, 텍스트, 이미지를 통합한 다중모달 이해를 위한 모델로, Per-vGrid와 Faithful-RFT를 통해 실시간 성능과 정확도를 동시에 달성한다.
- #314Unlocking the Potential of Image Editing via Concept Scaling and Dense Supervision
이미지 편집 모델의 성능을 향상시키기 위해 개념 세분화와 밀집된 지도 학습 전략을 제안하며, ConceptEdit-12M 데이터셋과 ConceptEdit-Bench 평가 도구를 제시한다.
- #315Graph Engineering in the Era of LLM Agents: From Individual Intelligence to System Intelligence
LLM 에이전트 시스템의 복잡성을 관리하기 위해 그래프 기반 구조를 도입한 System Intelligence와 Graph Engineering 패러다임을 제시한다.
- #316Hydra-0: Action Flow for Generalist World Modeling and Control
Hydra-0는 로봇 동작을 픽셀 운동으로 표현하는 Action Flow를 기반으로, 다양한 로봇과 환경에서 일반적인 월드 모델링과 제어를 실현한 시스템이다.
- #317Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts
대규모 MoE 모델의 학습률 최적화를 위해 계산 효율적인 2단계 하이퍼파라미터 전이 프레임워크를 제안한다.
- #318Prime Agent: A Self-Improving RLM Harness
Prime Agent는 장기적 작업을 위한 RLM 기반 오픈소스 에이전트 허브로, ARC-AGI-3 성능을 30%에서 95.5%까지 향상시킨다.
- #319ParaTempo: Efficient Parallel Reasoning via Temporal Confidence
ParaTempo는 시간적 신뢰도를 기반으로 병렬 추론 과정을 효율적으로 제어하여, 수학 및 과학적 추론에서 21.8–32.2%의 지연 감소와 18.1–30.3%의 토큰 사용 감소를 달성한 비학습형 비동기 프레임워크이다.
- #320OmniAssistBench: Assistant-style Interaction Benchmark for Omni-LLMs
OmniAssistBench는 실시간 비디오 어시스턴트로 활용되는 Omni-LLMs의 상호작용 능력을 평가하기 위한 새로운 벤치마크로, 기존 모델들의 시각적 지시, 장기 기억, 지연 응답 등에서 한계를 드러냈다.