- #1Challenges in Training PINNs: A Loss Landscape Perspective
PINN의 손실 경관이 학습에 미치는 영향을 분석하고, NysNewton-CG와 Adam+L-BFGS를 통해 학습 성능을 개선한다.
- #2Fact-Checking the Output of Large Language Models via Token-Level Uncertainty Quantification
대형 언어 모델의 생성물에 포함된 오류를 토큰 수준 불확실성 측정을 통해 탐지하는 새로운 팩트체킹 파이프라인을 제안한다.
- #3ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training
ZimaBlue는 대규모 영상 데이터를 활용해 일반화 가능한 월드 액션 모델(WAM)을 학습하는 3단계 훈련 프레임워크로, 120,000시간의 영상 학습으로 로봇 성공률을 36.1%에서 77.8%로 향상시킴.
- #4GaussianPro: 3D Gaussian Splatting with Progressive Propagation
GaussianPro는 3DGS의 초기화 문제를 해결하기 위해 MVS 기반의 점진적 전파 전략을 도입한 새로운 3D 가우시안 스플래팅 방법이다.
- #5Titans: Learning to Memorize at Test Time
Titans는 2M 이상의 컨텍스트 길이를 처리하면서 정확도를 향상시키는 신경망 장기 기억 모듈 기반의 새로운 아키텍처 패밀리이다.
- #6VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation
VILA-U는 단일 자동회귀 프레임워크로 시각 이해와 생성을 통합한 멀티모달 모델이다.
- #7OpenCodeInterpreter: Integrating Code Generation with Execution and Refinement
OpenCodeInterpreter는 실행 및 피드백 기반 반복 개선을 통합한 오픈소스 코드 생성 모델로, GPT-4 Code Interpreter와 유사한 성능을 보인다.
- #8SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding
SafeDecoding은 해킹 공격에 대응하는 안전 인식 디코딩 전략으로, 해악성 토큰 확률을 감소시키고 안전 선언 토큰 확률을 증가시켜 LLM의 안전성을 향상시킨다.
- #9Bench2Drive: Towards Multi-Ability Benchmarking of Closed-Loop End-To-End Autonomous Driving
Bench2Drive는 220개의 다양한 상황을 포함한 150m 길이의 루트를 통해 E2E-AD 시스템의 다중 능력을 평가하는 첫 번째 클로즈드-루프 벤치마크이다.
- #10Boosting Continual Learning of Vision-Language Models via Mixture-of-Experts Adapters
시각-언어 모델의 지속 학습 성능을 MoE-Adapters와 DDAS를 통해 60% 파라미터 절감과 3.6~7.0% 정확도 향상으로 개선.
- #11Learning to Reason under Off-Policy Guidance
LUFFY는 off-policy 학습을 결합한 RLVR 프레임워크로, 기존 on-policy 제약을 극복하고 수학 벤치마크에서 평균 +6.4 개선을 달성한다.
- #161ZipTok3D: High-Fidelity 3D Tokenization with Compact Token Prefixes
ZipTok3D는 극단적으로 짧은 토큰 시퀀스로도 고정밀 3D 재구성을 가능하게 하는 3D 토크나이저로, ShapeNet과 TRELLIS 데이터셋에서 각각 32배와 8배 짧은 토큰 수를 달성했다.
- #290Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills
DisCo는 GitHub 리포지토리에서 AI 연구에 필요한 운영 지식을 스킬로 추출해 연구 성능을 134.3%까지 향상시키는 연구 에이전트다.
- #292Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving
Qwen-Drive-1.0은 사전 학습된 시각-언어 모델에 3D 인식, 운전 질문 답변, 경로 계획을 통합한 자율 주행용 초거대 기초 모델이다.
- #300Tri-Band Channel Measurement-Enabled Multi-Layer Digital Twin for Terahertz Wireless Data Centers
THz 대역 무선 데이터센터를 위한 측정 기반 다층 디지털 트윈 프레임워크를 제안한다.
- #306Kirin: Animal Motion Generation from In-the-Wild Video
Kirin은 자연 상태의 동영상에서 동물 움직임을 생성하는 첫 번째 대규모 데이터셋과 모델을 제시한다.
- #307HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?
HarnessDev는 LLM이 실행 인프라를 생성하고 개선하는 능력을 평가하는 벤치마크로, 생성 및 진화 단계에서 성능과 효율성을 측정한다.
- #308SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models
SolarWM은 다양한 데이터와 모델 기반으로 실시간 대화형 영상 생성을 가능하게 하는 오픈 소스 월드 모델 기반 구조를 제시한다.
- #309Aspire: Can Models Self-Evolve from Vague Goals?
ASPIRE는 모델이 명확한 목표 없이 모호한 능력 목표로부터 스스로 진화할 수 있는 벤치마크를 제시한다.
- #310AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling
AgentJudgeBench는 DAG 기반 툴 호출 시스템 평가를 위한 다단계 LLM 판정자 신뢰도 벤치마크로, 3,808개의 인스턴스와 6개의 DAG 구조를 포함한다.
- #311EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction
EarlyEval은 LLM 에이전트 평가 비용을 절감하기 위해 중간 행동을 기반으로 조기 예측을 수행하는 경량 프레임워크이다.
- #312Does Imitation Learning Preserve Temporal Robustness in Dexterous Manipulation? An Expert-Learner Comparison Across Task Execution Speeds
ACT 정책은 전문가와 동일한 성능을 보이지만, 다양한 실행 속도에서의 타임스케일 견고성은 전문가보다 현저히 낮다.
- #313SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers
SMELT는 계산 예산을 일치시키면서 반복된 중간 레이어를 통해 Transformer 성능을 6.8–18.0% 개선하는 MoE 기반 설계법이다.
- #314It Takes Two to Match: Co-Evolving Generative Retriever with Reinforcement Learning
CoGR은 쿼리와 아이템 양쪽에서 키워드를 생성해 매칭하는 생성형 검색 프레임워크로, F₁ 성능을 기존 베이스라인 대비 최대 36.1% 개선한다.
- #315UI-Venus-2 Technical Report
UI-Venus-2는 모바일, 웹, 데스크톱 환경에서 작동하는 다목적 GUI 에이전트로, 170개 이상의 앱과 강력한 검증 메커니즘을 통해 실용성을 확보한다.
- #316Sim2Signal: Sim-to-Real Benchmarks for Traffic Signal Control
Sim2Signal은 교차로 신호 제어에서 Sim-to-Real 갭을 체계적으로 평가하기 위한 벤치마크로, 33개 갭 설정과 10개 실제 도시 네트워크에서 18개 완화 방법을 평가한다.
- #317Language Models Can Control Their Own Attention
언어 모델이 자체적으로 주의 영역을 선언하는 Declarative Attention(DA) 프로토콜을 제안하여, KV 캐시 접근을 최소화하고 효율성을 높인다.
- #318From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix
기업 내 200개 이상의 애플리케이션 트래픽을 단일 모델로 통합하여 GPU 자원을 절약하고 성능을 개선한 내부 LLM 포스트 트레이닝 방법론을 제시한다.
- #319SnapBench: Benchmarking Snap-and-Ask Multimodal Retrieval for Mobile Interactions
SnapBench는 모바일 환경에서 사진과 질문을 결합한 다중모달 검색의 안정성을 평가하는 최초의 페어형 벤치마크이다.
- #320Beyond Visual Similarity: Entity-Aligned Retrieval for Knowledge-Based Visual Question Answering
KBMR은 KB-VQA에서 CLIP 기반 검색의 한계를 극복한 MLLM 기반 검색기로, 최대 14.7%의 Recall@1 개선을 달성했다.