한 줄 요약
C3LM 모델을 Top-K 프롬프팅과 ChemCensor 기반 보상으로 훈련하여 URSA-expert-2026 벤치마크에서 최고 성능을 달성했다.
핵심 기여도
- **Top-K 프롬프팅** 도입으로 단계별 반응 다양성을 향상 (Av. PT-Top-10 기준 +0.60 개선).
- **CREED-CCV-2+USPTO-XL** 데이터셋 (~45.6M) 구축, 기존 데이터 대비 6배 이상 확장.
- **ChemCensor 및 Novelty Reward 기반 RFT** 적용으로 OOD URSA-expert-2026에서 기존 모델을 초과 (Max/@10 +0.02, Av. PT-Top-10 +0.08).
- **LLM과 전통 모델의 반응 공간 보완성** 분석, 앙상블 시스템 설계 동기 부여.
핵심 아이디어
단계별 반응 생성의 one-to-many 특성을 반영하기 위해 **Top-K 프롬프팅**을 도입하여 단일 답변 평가의 한계를 극복했다. 기존의 Top-1 방식 대비 **Top-K (K=15)** 모드는 반응 다양성과 가능성성을 동시에 강화하는 효과를 보였다.
C3LM은 **CREED-CCV-2+USPTO-XL** (~45.6M) 데이터셋을 기반으로 훈련되며, **ChemCensor 기반 필터링**과 **Novelty Reward**를 통한 **RFT (Reward Fine-Tuning)**을 적용하여 반응의 화학적 타당성과 독창성을 동시에 강화했다. 특히, **Av. PT-Top-10** 지표는 반응 다양성에 가장 민감하며, Top-K 모드 전환 시 2.5배 이상의 성능 향상이 관찰되었다.
이러한 접근은 **LLM이 단계별 반응 생성에서 전통 모델과 보완적인 역할**을 할 수 있음을 입증하며, **앙상블 기반 합성 계획 시스템** 설계를 위한 기초를 제공한다.
기술적 접근법
- **모델**: C3LM-LFM2 (Large Foundation Model 2)
- **데이터셋**: CREED-CCV-2+USPTO-XL (~45.6M)
- **훈련 방식**:
- **Top-K 프롬프팅 (K=15)**: 15개 반응 생성 후 평가
- **RFT (Reward Fine-Tuning)**: ChemCensor (CC) + Novelty Reward (NR) 기반
- **평가 지표**:
- **Av. PT-Top-K CC**, **Av. PT-Max CC**, **Max/@3/@5/@10**
- **하이퍼파라미터**:
- Top-K 모드에서 Av. PT-Top-10 기준 +0.60 개선
- RFT 적용 시 Max/@10 +0.02, Av. PT-Top-10 +0.08
주요 결과
- **C3LM-LFM2-RFT-CC-NR**는 URSA-expert-2026에서 **Av. PT-Top-10 +0.08**, **Max +0.02** 개선.
- **Top-K 모드** 전환 시 Av. PT-Top-10 기준 **+0.60** 향상 (Top-1 대비).
- **CREED-CCV-2+USPTO-XL** 데이터 확장으로 Max/@10 +0.29 개선.
- **USPTO-50K-test-mini**에서 Av. PT-Top-10 기준 **C3LM-LFM2-RFT-CC-NR**가 2위, 기존 모델 대비 독창성 증명.
의의 및 한계
C3LM은 **LLM 기반 단계별 합성 계획**에서 화학적 타당성과 반응 다양성을 동시에 강화하는 새로운 훈련 패러다임을 제시한다. 특히, **Top-K 프롬프팅**과 **ChemCensor 기반 RFT**는 기존 평가 체계의 한계를 극복하며, **앙상블 기반 시스템** 설계 가능성을 열었다.
하지만, **ChemCensor 기반 평가와 훈련 간의 부분적 순환성**은 모델의 일반화 능력에 영향을 줄 수 있다. 또한, **URSA-expert-2026**과 같은 OOD 데이터셋에서의 성능 향상은 **데이터 누수 가능성**을 고려해야 한다. **Av. PT-Top-10** 기준으로도 **+0.44** 개선 여지가 남아 있어, 모델의 최적화 여지가 있다.
실용적 활용
C3LM은 **의약품 개발 초기 단계의 합성 가능성 평가**, **컴퓨터 지원 합성 계획 시스템 (CASP)**, **LLM 기반 반응 생성 도구** 등에 활용 가능하다. 특히, **Top-K 프롬프팅**과 **RFT 기반 훈련**은 화학 연구자들이 다양한 반응 경로를 탐색하는 데 유용한 도구가 될 수 있다.