- #1Data Scaling Laws in Imitation Learning for Robotic Manipulation
로봇 조작에서 데이터 확장 법칙을 규명하고, 환경과 객체 다양성에 따른 정책 일반화 성능을 실증적으로 분석한다.
- #3Layer by Layer: Uncovering Hidden Representations in Language Models
중간층은 최종층보다 더 뛰어난 표현력을 가지며, 이를 정보 이론, 기하학, 불변성 기반의 통합 평가 프레임워크로 분석한다.
- #4MambaOut: Do We Really Need Mamba for Vision?*
이미지넷 분류에서는 Mamba가 불필요하지만, 감지 및 세그멘테이션에서는 잠재력이 있다.
- #5Knowledge Conflicts for LLMs: A Survey
이 논문은 LLM에서 발생하는 지식 충돌(Knowledge Conflicts)을 체계적으로 분류하고, 원인, 행동, 해결 전략을 조사한 서베이 논문이다.
- #6Do Llamas Work in English? On the Latent Language of Multilingual Transformers
Llama-2 모델이 비영어 입력을 처리할 때 내부적으로 영어를 피벗 언어로 사용하는지, 이를 잠재 임베딩 공간을 분석하여 실증적으로 조사한 연구이다.
- #7MoGe: Unlocking Accurate Monocular Geometry Estimation for Open-Domain Images with Optimal Training Supervision
MoGe는 단일 이미지에서 정확한 3D 기하학을 추정하는 모델로, affine-invariant 표현과 ROE 정렬 알고리즘, multi-scale 로스를 통해 기존 방법 대비 35% 이상의 오류 감소를 달성한다.
- #8mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models
mPLUG-Owl3는 초장 이미지 시퀀스를 처리하는 다중 모달 대형 언어 모델로, Hyper Attention을 도입해 시각-언어 통합 성능을 향상시킨다.
- #9Champ: Controllable and Consistent Human Image Animation with 3D Parametric Guidance
CHAMP은 SMPL 모델을 기반으로 3D 파라메트릭 가이던스를 결합하여 사람 이미지 애니메이션의 형태 정렬과 움직임 지도를 향상시킨다.
- #10ReEvo: Large Language Models as Hyper-Heuristics with Reflective Evolution
ReEvo는 LLM과 진화적 탐색을 결합한 Language Hyper-Heuristics를 통해 COP 해결 성능을 향상시키는 새로운 방법이다.
- #11An Image is Worth 32 Tokens for Reconstruction and Generation
TiTok은 1D 이미지 토큰화를 통해 고해상도 이미지 생성을 32개 토큰으로 가능하게 하며, 기존 2D 방법 대비 410배 빠른 생성 속도를 달성한다.
- #316TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback
TacForcing는 실행 중 터치 피드백을 활용한 스트리밍 액션 생성 프레임워크로, 실시간 접촉 상태 변화에 대응한다.
- #318Is Next-Chunk Reasoning RL Really Better than SFT? Revisiting Training Strategies under no-CoT Data
Mixed SFT는 next-chunk reasoning RL보다 훨씬 저렴하면서도 높은 post-RLVR 성능을 달성한다.
- #319Open-MOPD: Diagnosing and Fixing Capability Imbalance in Multi-Teacher On-Policy Distillation
Open-MOPD는 다중 전문가 정책 증류에서 발생하는 능력 불균형을 진단하고 해결하는 프레임워크로, 토큰 수준 최적화 예산의 부적절한 할당 문제를 해결하여 성능 회복률을 35.6%에서 83.4%로 향상시킨다.
- #320Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds
JoyAI-Echo-1.5는 장기적 영상 생성과 인터랙티브 월드 모델링을 위한 통합 오디오-비주얼 생성 시스템으로, 메모리, 기하학적 제어, 롤아웃 기반 학습을 결합하여 일관성과 제어력을 향상시킨다.
- #321Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO
진화 전략(Evolution Strategies, ES)이 GRPO보다 더 넓은 추론 커버리지를 제공하며, Pass@K 성능을 향상시킨다.
- #322Video-IFBench: Evaluating Instruction Following of Multimodal LLMs in Video Understanding Scenarios
Video-IFBench는 영상 이해 시 사용자 지시사항을 충족하는 다중모달 대형 언어 모델(MLLM)의 능력을 평가하는 새로운 벤치마크이다.
- #323V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning
V-Rubrics는 시각적 근거성을 세부 항목 기반 강화 학습으로 향상시키는 VLM 후학습 프레임워크이다.
- #324SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?
SWE Refactor Bench는 코드 생성 에이전트가 전체 레포지토리 마이그레이션을 완료할 수 있는지 평가하는 3단계 벤치마크로, 5.4%만 모든 단계를 통과했다.
- #325WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution
WikiSkill은 지속적인 지식 축적을 통해 에이전트의 스킬 진화를 촉진하는 프레임워크로, 다양한 벤치마크에서 기존 방법을 상회한다.
- #326The Handoff Tax: Continuing Non-Native Trajectories in LLM Agents
LLM 에이전트에서 모델 전환 시 발생하는 비용-품질 저하 현상을 'Handoff Tax'로 명명하고, Claude와 GPT 모델을 통해 실험적으로 분석한다.
- #327Rubrics as Visual-Repair Context for Self-Evolving UI-to-Code Generation
RubSE는 UI-to-code 생성 과정에서 발생하는 시각적 복구 결합 문제를 해결하기 위해 구조화된 rubric 기반 자기진화 프레임워크를 제시한다.
- #328Are Android GUI Agents Robust Against Runtime Anomalies? AnTrap: Evaluating Agents in Dynamic Adversarial Environments
AnTrap은 안드로이드 GUI 에이전트의 런타임 이상 상황에서의 회복력을 체계적으로 평가하는 벤치마크로, 16개 모델이 다양한 이상 상황에 취약함을 밝혀냈다.
- #330Gated Recurrent Transformers: Expressive Depth through Recurrent Modulation
Gated Recurrent Transformer는 재귀적 깊이를 활용해 파라미터 수를 줄이면서도 모델 성능을 유지하는 새로운 트랜스포머 구조를 제안한다.
- #331Luce: Relightable Gaussians for 3D Asset Generation
Luce는 이미지에서 재조명 가능한 3D 자산을 생성하기 위한 다중 모달 PBR 가우시안 표현을 제안하며, 기존 기법 대비 28% 개선된 FID 성능을 보인다.
- #332GUI-Primitives: Diagnosing Spatial Reasoning Failures in Vision-Language GUI Grounding
GUI-Primitives는 GUI 화면에서 공간 관계를 이해하는 능력을 평가하는 대규모 벤치마크로, 기존 모델들이 공간 관계를 파악하는 데 어려움을 겪는 문제를 진단한다.
- #333CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes
CritICL은 약한 모델의 실패 패턴을 활용해 강한 모델의 추론 성능을 향상시키는 추론 시 효율적인 프레임워크이다.
- #334CaRGo-T: Causal Reasoning Graph-of-Thought improves Multimodal Humor Comprehension
CaRGo-T는 멀티모달 유머 이해를 위해 인과 관계를 그래프로 표현하는 새로운 추론 프레임워크로, 기존 방법 대비 1-20% 성능 향상을 보인다.
- #335Magpie: Real-Time World Renderer for Interactive Games
Magpie는 게임 엔진과 독립된 렌더 서버를 통해 실시간 생성 렌더링을 구현한 게임 시스템이다.
- #336CaSKG: Counterfactual-Causal Skill Graphs for Scalable Agent Skill Retrieval
CaSKG는 카운터패클-인과적 스킬 그래프를 통해 대규모 스킬 라이브러리에서 효과적인 스킬 검색을 가능하게 하는 프레임워크로, ALFWorld와 ScienceWorld에서 기존 방법 대비 8% 이상 성능 향상을 달성했다.
- #337Stream4D: 4D-Consistency for Streaming Autoregressive Diffusion Video Models
Stream4D는 4D 일관성을 강화한 강화학습 기반 스트리밍 자동회귀 확산 영상 모델 훈련 프레임워크로, 4D-PSNR 6.76 dB 개선을 달성한다.