- #1Co-Evolution in Agentic Systems: Toward Self-Directed Evolution Beyond Human Design
본 논문은 에이전트 시스템에서의 공동진화(co-evolution)를 다층적 세 단계 분류로 체계화하고, 인간 설계를 벗어난 자기 주도적 진화의 가능성을 탐색한다.
- #2Physics-Informed Machine Learning in Prognostics and Health Management: A Systematic Literature Review
PIML을 PHM에 적용한 212개 연구를 체계적으로 검토하여, 성능 개선 효과와 한계를 분석하고 미래 연구 방향을 제시한다.
- #3Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning
고량이 높은 소수의 토큰(포킹 토큰)을 선택적으로 최적화함으로써 Qwen3-32B 기반 모델에서 AIME'25에서 +11.04, AIME'24에서 +7.71의 성능 향상이 관찰되었다.
- #4A Survey on RAG Meeting LLMs: Towards Retrieval-Augmented Large Language Models
RAG를 활용한 대규모 언어 모델(RA-LLMs)의 연구 동향과 기술적 한계를 체계적으로 조사한 서베이 논문.
- #5Evaluating Text-to-Visual Generation with Image-to-Text Generation
VQAScore를 제안하여 CLIPScore보다 향상된 텍스트-비주얼 생성 모델 평가를 실현하고, GenAI-Bench라는 새로운 벤치마크를 소개한다.
- #6Rewrite the Stars
"Star operation"이 고차원 비선형 특징 공간을 생성함으로써 효율적 모델 StarNet의 성능을 향상시킨다.
- #7GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection
GaLore는 LLaMA 7B 모델을 24GB GPU에서 훈련할 수 있도록 하며, 최적화 상태 메모리를 최대 65.5% 절감하는 기울기 저랭크 투영 기반 훈련 전략이다.
- #8F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching
F5-TTS는 ConvNeXt와 Sway Sampling을 도입한 비자기회귀 TTS 모델로, 100K시간 다국어 데이터셋에서 0.15의 RTF를 달성하고 제로샷 생성 능력을 보인다.
- #9MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark
MMMU-Pro는 MMMU 벤치마크를 기반으로, 시각-언어 통합 능력을 엄격히 평가하는 새로운 멀티모달 평가 기준이다.
- #10ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search
ReST-MCTS*는 MCTS* 기반 트리 탐색을 통해 과정 보상 모델과 정책 모델을 자가 학습하는 LLM 자기 학습 프레임워크이다.
- #11Generative Verifiers: Reward Modeling as Next-Token Prediction
GenRM은 생성형 검증기로, 다음 토큰 예측을 통해 LLM의 생성 능력을 활용해 검증 성능을 73% → 93.4%까지 향상시킨다.
- #12From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline
BenchBuilder 파이프라인을 통해 자동화된 고질량 벤치마크 Arena-Hard-Auto를 구축하여 98.6%의 인간 선호도와 3배 높은 모델 구분력을 달성.
- #46ComBodied Agents: a New Paradigm of Human-Centric Agentic AI
Combodied Agents는 인간의 상태와 자율성을 중심으로 한 새로운 Agentic AI 패러다임으로, 개인의 장기적 이익을 지속적으로 지원한다.
- #294BDH-CQ: In-Context Learning with Recurrent Latent Reasoning
BDH-CQ는 150M 파라미터로 ARC-AGI-1에서 29.5% pass@2를 달성한, 반복적 잠재 공간 추론과 인-컨텍스트 학습을 결합한 새로운 추론 모델이다.
- #300RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance
RynnValue는 7,000시간 이상의 데이터로 학습된 로봇 가치 기초 모델로, 시간 거리 기반의 보상 인터페이스를 통해 정량적 성능을 향상시킨다.
- #301Mendel G\"odel Machine: Recursive Self-Improving Coding Agents via Comparative Evolution
Mendel G\"odel Machine(MGM)은 비교적 신뢰성 높은 자기 개선 전략을 통해 코드 에이전트 성능을 50.8%에서 93.3%까지 향상시킨다.
- #307Articulated Object Reconstruction from Rest-State Observation
Rest2Art는 단일 닫힌 상태에서 관절 구조와 3D 기하학을 복원하는 새로운 아티큘레이션 객체 재구성 프레임워크이다.
- #308On-Policy Self-Distillation without Any Supervision
U-OPSD는 외부 지도 없이 모델 자체의 생성물만으로 이루어지는 비지도 온-폴리시 자기-디스틸레이션 방법이다.
- #309Beyond Pixels: From Video Priors to 4D Worlds
Latent-to-4D는 VAE 공유 공간 내의 비디오 레이턴트를 직접 4D 생성에 연결하여 기존 방식의 한계를 극복한다.
- #310Scaling Inherently Interpretable Language Models
Steerling-8B는 학습 과정에서 해석성을 명시적으로 설계한 확장 가능한 언어 모델로, 1.2트릴리온 토큰 학습 후 1500억 토큰의 미드트레이닝을 거쳐 기존 모델과 유사한 성능을 보인다.
- #311Stealing Reasoning Traces from Proprietary LLM APIs
프로피에터리 LLM API의 암호화 추론 흐름을 해킹하여 정보 유출 가능성을 보여준 연구.
- #312Agent Memory Distillation: Empowering Small LLM Agents with Hierarchical Teacher Memory
AMD는 GPT-5-mini의 계층적 메모리를 활용해 4B-8B 소형 모델의 정확도를 평균 27.2%p 향상시키는 훈련 없는 메모리 디스틸레이션 프레임워크다.
- #313Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustness
Decoding-Level Taboo는 생성 경로를 강제로 변경하여 LLM의 실제 세계 내구성을 진단하는 런타임 로짓 공간 개입 기법이다.
- #314The Loss Does Not See the Basis, but Adam Does
Adam 최적화기는 기저 선택에 민감해 저축도 해를 찾지 못하지만, equivariant 최적화기는 저축도 성능을 보인다.
- #315What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systems
Qwen 앱에서 이미지 생성 대화에서 시각적 일관성을 유지하면서 사용자 선호를 반영한 편집 제안을 생성하기 위한 3단계 프레임워크를 제안한다.
- #316OasisKV: Scaling In-Decode KV Cache Beyond HBM with Lookahead Sparse Prefetching
OasisKV는 추론 시 HBM 메모리 부담을 줄이며 1.69× 이상의 처리량 향상을 달성하는 키-벨류 캐시 최적화 시스템이다.
- #317AdvFD: Boosting Visual Generation via Adversarial Fr'echet Distance Loss
AdvFD는 정적 특징 공간의 한계를 극복하기 위해 적대적 학습을 통한 Fréchet 거리 최적화를 제안하여 시각 생성 품질을 향상시킨다.
- #318Business Arena: Benchmarking LLM Agents in a Realistic Marketplace
Business Arena는 AI 에이전트의 실제 비즈니스 운영 능력을 평가하는 벤치마크 환경으로, 15개 모델 간 최대 9배의 자산 차이를 기록했다.
- #319VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?
VibeLifeBench는 일상 생활 도메인에서 주도적이고 지속적인 대리인의 능력을 평가하기 위한 200개의 장기 태스크 기반 벤치마크이다.
- #320A^2E : An End-to-End Agent Auditing Engine
A²E는 대규모 언어 모델 기반 에이전트의 시스템적 평가를 위한 엔드투엔드 평가 엔진으로, ATP 프로토콜과 모니터링, 다차원 메트릭을 통해 다양한 헤이서스를 통합적으로 평가한다.