한 줄 요약
Safin-1은 내재적 안전성을 구현하기 위해 메모리 기반 상태 진화와 라우팅을 결합한 기초 모델로, Safety from Within 원칙을 구현한다.
핵심 기여도
- **MARCH (Memory-Anchor Routing across Context History)**: 구조화된 메모리 상태를 유지하고, 컨텐츠 조건에 따라 선택적으로 과거 정보를 검색하는 새로운 네트워크 아키텍처를 제안.
- **Safety State**: 안전 관련 기능을 모델 내부 상태로 표현하여, 학습된 안전 상태를 추론 시점에 동적으로 적용 가능하게 함.
- **0.8B에서 35B-A3B까지 확장 가능**: MARCH 기반 모델은 0.8B에서 4B, 35B-A3B로 확장되며, 10개의 능력 벤치마크에서 66.79 → 69.20, 76.25 → 78.35의 성능 향상.
- **안전성 향상**: WildJailbreak, FORTRESS 등 안전성 벤치마크에서 공격 성공률 감소 및 과거절 거부율 감소를 보임.
핵심 아이디어
Safin-1은 안전성이 외부 제약이나 사후 정렬에 의존하는 것이 아니라, 모델 자체의 내재적 특성으로 구현되어야 한다는 **Safety from Within** 원칙을 기반으로 설계되었다. 이는 모델이 과거 상황을 기반으로 적절한 행동을 선택적으로 실행할 수 있도록 하기 위해, **메모리 라우팅**과 **상태 진화**를 결합한 새로운 접근법이다.
기존 언어 모델은 컨텍스트를 토큰 기반의 키-값 캐시나 순환 상태로 유지하지만, 안전성과 같은 반복적으로 필요한 기능은 모델 업데이트나 어댑터를 통해 구현된다. Safin-1은 이 문제를 해결하기 위해 **MARCH** 아키텍처를 도입한다. 이 아키텍처는 **state anchors**를 주기적으로 저장하고, **content-conditioned routing**을 통해 필요한 과거 상태를 선택적으로 검색한다.
또한, Safin-1은 **Safety State**라는 모듈을 통해 안전성 기능을 학습하고, 이 상태를 추론 시점에 모델 내부 상태로 적용할 수 있도록 한다. 이는 기존 언어 모델 백본을 수정하지 않고도 안전성을 강화할 수 있는 새로운 방식이다.
기술적 접근법
- **MARCH (Memory-Anchor Routing across Context History)**:
- **State anchors**: 순환 백본이 주기적으로 상태를 저장하여, 각 anchor는 **state-aware routing key**와 함께 저장됨.
- **Routing**: 각 토큰은 컨텐츠 조건에 따라 적절한 과거 상태를 검색하고, 현재 순환 경로에 융합됨.
- **Parameter**: 라우팅 차원은 $ d_r = 64 $, state anchors는 $ C = 512 $ 토큰마다 저장됨.
- **Safety State**:
- 학습된 안전성 상태를 **context-derived anchors**와 동일한 메모리 뱅크에 저장.
- 언어 모델 백본은 동결 상태이며, Safety State는 라우터를 통해 각 토큰에 기여도를 결정.
- **모델 확장**:
- 0.8B, 4B, 35B-A3B 버전으로 확장.
- **Gated DeltaNet (GDN), Kimi Delta Attention (KDA), Gated DeltaNet-2 (GDN2)** 등 다양한 순환 업데이트 규칙과 호환.
- **학습 프로토콜**:
- **Long-Data-Collections**에서 50B 토큰으로 사전 학습.
- 최대 시퀀스 길이: 16K.
주요 결과
- **10개 능력 벤치마크 평균 성능 향상**:
- 0.8B → 4B: 66.79 → 69.20 (+2.41%)
- 0.8B → 35B-A3B: 76.25 → 78.35 (+2.10%)
- **안전성 향상**:
- **WildJailbreak**: 공격 성공률 감소 (명시되지 않음)
- **XSTest**: 과거절 거부율 감소 (ORR; lower is better)
- **추론 효율성**:
- MARCH 기반 모델은 LongBench, RULER-NIAH 등에서 실질적인 추론 성능 향상 보임.
의의 및 한계
Safin-1은 **안전성**을 모델 내부 상태로 표현하고, **동적 라우팅**을 통해 선택적으로 적용하는 새로운 패러다임을 제시한다. 이는 기존 안전성 강화 방식(예: 사후 정렬, 감독 미세 조정)에 의존하지 않고, 모델 자체의 계산 과정 내에서 안전성을 유지할 수 있다는 점에서 혁신적이다. 또한, MARCH 아키텍처는 **장기 추론**과 **메모리 효율성**을 동시에 달성하며, 다양한 모델 규모(0.8B ~ 35B)에서 일관된 성능 향상을 보인다.
하지만, 이 연구는 **Safety from Within**의 초기 아키텍처 탐색에 불과하며, 더 넓은 범위의 안전성 기능과 복잡한 상황에서의 일반화 능력은 추가 연구가 필요하다. 또한, Safety State는 특정 안전성 태스크에만 적용되었으며, 다른 기능(예: 코드 생성, 지식 추론)에의 확장 가능성은 명시되지 않았다.
실용적 활용
Safin-1은 장기 추론, 안전성 강화, 메모리 효율적