한 줄 요약
LLM을 활용한 제조 공정 시계열 데이터 생성 프레임워크를 제안한다.
핵심 기여도
- 사전 학습된 LLM을 제조 공정 설명서에 fine-tuning하여 시계열 생성 가능성을 제시.
- Retrieval Augmented Generation (RAG) 기법을 도입해 데이터 다양성과 현실성을 향상.
- ARIMA, LSTM 등 기존 시계열 모델 대비 생성 데이터의 질이 우수함을 실증.
- 생성 데이터를 활용한 이상 탐지 성능 향상 효과를 보여줌.
핵심 아이디어
기존 제조 분야에서 라벨이 부족한 시계열 데이터는 머신러닝 모델 개발에 큰 장애가 된다. 이를 해결하기 위해, 본 연구는 LLM이 복잡한 시간적 의존성을 학습하고, 제조 공정 설명서를 기반으로 시계열 데이터를 생성할 수 있음을 제시한다. 특히, RAG 기법을 통해 실제 데이터와 유사한 패턴을 유지하면서도 다양성을 확보하는 것이 핵심이다. 이는 LLM이 텍스트에서 숨겨진 시계열 구조를 추출하고 생성하는 새로운 접근법을 의미한다.
기술적 접근법
- 사전 학습된 LLM을 제조 공정 설명서 데이터에 fine-tuning.
- Retrieval Augmented Generation (RAG) 기법을 도입하여 데이터 생성 단계에서 참고 문서를 검색하고 이를 기반으로 생성.
- 생성된 데이터는 PCA 분석, 양적 지표, 이상 탐지 성능 평가를 통해 검증됨.
- 비교 모델로는 ARIMA, LSTM 사용.
주요 결과
- 제안된 LLM 기반 프레임워크는 ARIMA, LSTM 대비 시계열 데이터 생성의 질이 우수함을 보여.
- 생성 데이터는 실제 제조 데이터의 통계적 특성과 시간적 의존성을 효과적으로 반영함.
- 이상 탐지 성능에서 +12.3% 개선 효과를 기록 (베이스라인 대비).
의의 및 한계
본 연구는 LLM이 제조 분야에서 시계열 데이터 생성에 활용될 수 있음을 실증적으로 보여주며, 데이터 부족 문제를 해결하는 새로운 방향을 제시한다. 또한, RAG 기법을 통해 생성 데이터의 현실성과 다양성을 동시에 확보한 점이 학술적 의의이다. 그러나, 제안된 방법이 특정 제조 환경에만 적용 가능할 수 있으며, 실제 산업 현장에서의 확장성과 안정성 검증이 필요하다는 한계가 있다.
실용적 활용
본 연구는 제조 분야에서 라벨 데이터가 부족한 상황에서 머신러닝 모델 훈련용 데이터를 생성하는 데 유용하게 활용될 수 있다. 특히, 이상 탐지, 예측 유지보수 등과 같은 산업용 AI 시스템 개발에 적용 가능하다.