- #1PhysAttNet: Enhancing Predictive Performance in Industrial and Astrophysical Time Series via Physics-Informed Attention
PhysAttNet은 물리 기반 주의 정규화를 통해 CNN 기반 시계열 예측 모델의 정확도와 해석성을 동시에 향상시키는 신경망 구조이다.
- #2Scaling Inherently Interpretable Language Models
Steerling-8B는 학습 과정에서 해석성을 명시적으로 설계한 확장 가능한 언어 모델로, 1.2트릴리온 토큰 학습 후 1500억 토큰의 미드트레이닝을 거쳐 기존 모델과 유사한 성능을 보인다.
- #3LESS: Selecting Influential Data for Targeted Instruction Tuning
LESS는 대규모 언어 모델의 특정 능력 향상을 위해 5%의 데이터만으로도 전체 데이터셋보다 우수한 성능을 보이는 데이터 선택 알고리즘이다.
- #4Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks
최신 안전 정렬된 LLM도 간단한 적응형 공격으로 제한 해제가 가능하다는 것을 보여준다.
- #5NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models
NV-Embed는 디코더-온리 LLM을 활용한 다목적 임베딩 모델로, MTEB 벤치마크에서 69.32 점을 달성하며 1위를 기록했다.
- #6Scaling and evaluating sparse autoencoders
GPT-4 활성화를 400억 토큰으로 학습한 1600만 레이턴트 SAE를 통해 체계적인 스케일링 법칙과 새로운 평가 지표를 제시한다.
- #7EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty
EAGLE는 LLaMA2-Chat 70B 모델에서 2.7x-3.5x의 지연 감소를 달성한 효율적인 추측 샘플링 프레임워크이다.
- #8LlaVA-CoT: Let Vision Language Models Reason Step-By-Step
LLaVA-CoT는 시각적 추론을 단계별로 수행하는 VLM으로, 10만 개의 데이터셋과 SWIRES를 통해 기존 모델을 9.4% 초과.
- #9Continuous 3D Perception Model with Persistent State
CUT3R은 지속적으로 업데이트되는 내부 상태를 활용해 3D 환경을 온라인으로 재구성하는 통합 3D 인식 모델이다.
- #10Visual-RFT: Visual Reinforcement Fine-Tuning
Visual-RFT는 시각 인식 작업에서 데이터 효율적인 강화 학습 기반 미세 조정을 제안하여 SFT 대비 24.3%의 정확도 향상을 달성한 연구이다.
- #11Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research
Dolma는 3조 토큰 규모의 영어 사전 학습 데이터셋으로, OLMo 모델 학습에 사용된 개방형 언어 모델 연구를 위한 기반 자료이다.
- #12BioMistral: A Collection of Open-Source Pretrained Large Language Models for Medical Domains
BioMistral 7B는 PubMed Central로 사전 학습된 의료 분야 대형 언어 모델로, 10개 영어 QA 태스크와 7개 언어로 번역된 다국어 평가에서 기존 오픈소스 모델을 상회하는 성능을 보인다.
- #163What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systems
Qwen 앱에서 이미지 생성 대화에서 시각적 일관성을 유지하면서 사용자 선호를 반영한 편집 제안을 생성하기 위한 3단계 프레임워크를 제안한다.
- #304LUCID: Latent-Skill Unified Control via Imagined Dynamics for Long-Horizon Humanoid Loco-Manipulation
LUCID는 상상된 역학을 기반으로 인간형 로봇의 장기적 로코-조작을 위한 계층적 모델 기반 강화 학습 프레임워크이다.
- #305From Benchmark Performance to Tool Deployment: Human-in-the-Loop Anomaly Detection
19개의 비지도 이상 탐지 모델이 산업 현장 데이터셋에서 기대 이하의 성능을 보여, 인간-인-더-루프(HITL) 프레임워크를 제안한다.
- #306RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance
RynnValue는 7,000시간 이상의 데이터로 학습된 로봇 가치 기초 모델로, 시간 거리 기반의 보상 인터페이스를 통해 정량적 성능을 향상시킨다.
- #307BDH-CQ: In-Context Learning with Recurrent Latent Reasoning
BDH-CQ는 150M 파라미터로 ARC-AGI-1에서 29.5% pass@2를 달성한, 반복적 잠재 공간 추론과 인-컨텍스트 학습을 결합한 새로운 추론 모델이다.
- #308Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA
Macaron-V1은 경험 학습과 협업을 위한 개방형 지속 학습 시스템으로, Mixture-of-LoRA와 자기 개선 루프를 결합한 모델이다.
- #309SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring
SWE-Bench ProMax는 7개 언어에 걸쳐 170개의 실제 커밋 기반 리팩토링 태스크로, 기존 벤치마크의 한계를 극복한 다국어 코드 리팩토링 평가 기준이다.
- #310DCAS: Decoupling CLI Agent Scaffolding to Internalize Planning across Scaffolds
DCAS는 CLI 에이전트의 플래닝 구조를 학습 가능한 모델 기능으로 전환하여 다양한 스크래프에서의 성능 저하를 해결한다.
- #311When Activation Oracles Learn Not to Read: Concept-Specific Blind Spots in Fine-Tuned Oracles
AO가 훈련된 개념을 의도적으로 회피하는 현상을 밝혀내며, 학습된 해석 도구의 신뢰성 문제를 제기한다.
- #312Enfold: Folding World Model Imagination into Predictive Representations for Ultra-Efficient Embodied Control
Enfold는 미래 생성 과정을 현재 관측에서 예측 가능한 표현으로 전이하여, 제어 성능을 유지하면서 3.7~10.1배의 액션 지연 감소를 달성한 시스템이다.
- #313Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution
Ouroboros는 자체 개선을 통해 코딩 에이전트 성능을 향상시키는 시스템으로, Terminal-Bench 2.1에서 86.74%를 달성했다.
- #314SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs
SFT는 다단계 학습에서 성능 저하를 겪지만, RL은 거의 직교적인 업데이트로 안정적 성능 향상을 보인다.
- #315Beyond Simply Environment Scaling: Designing Effective Environment Distributions for Multimodal Agent Learning
AES와 HDC를 통해 다중모달 에이전트 학습의 환경 분포를 효과적으로 설계하는 방법을 제안한다.
- #316Agent Memory Distillation: Empowering Small LLM Agents with Hierarchical Teacher Memory
AMD는 GPT-5-mini의 계층적 메모리를 활용해 4B-8B 소형 모델의 정확도를 평균 27.2%p 향상시키는 훈련 없는 메모리 디스틸레이션 프레임워크다.
- #317Motif 3: Technical Report
Motif 3는 3140억 파라미터를 가진 MoE 언어 모델로, GDLA와 다양한 최적화 기법을 통해 다중 분야에서 뛰어난 성능을 보인다.
- #318MatrAIx: Simulating the World with 8.3 Billion Persona Agents
MatrAIx는 83억 개의 인물 기반 시뮬레이션을 통해 AI 시스템과 디지털 제품을 다각도로 평가하는 인프라를 제시한다.
- #319Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains
Sci-VBench는 과학 분야에서 지식과 추론이 필요한 동영상 생성 모델을 평가하는 벤치마크로, 1,253개의 전문가 주석이 담긴 예제를 포함한다.
- #320Stealing Reasoning Traces from Proprietary LLM APIs
프로피에터리 LLM API의 암호화 추론 흐름을 해킹하여 정보 유출 가능성을 보여준 연구.