한 줄 요약
Industrial-Instruction은 산업 기술 보고서를 기반으로 QA 데이터셋과 생성 파이프라인을 제공하여 산업 벤치마크 및 훈련 데이터를 구축하는 실용적이고 재현 가능한 방법을 제시한다.
핵심 기여도
- 두 개의 QA 데이터셋 생성: Panasonic 문서(906개, 7,525페이지)를 기반으로 13.6k QA 쌍 제공.
- 5가지 질의-문서 관계 모델링: irrelevant retrieval, single-/multi-document support, single-/multi-document answer.
- Qwen3-30B-A3B-Instruct와 Claude-Opus-4.6 모델로 생성한 두 버전의 데이터셋을 비교 제공.
- 10B 미만 파라미터 소형 모델에서 Set-Match Accuracy 28.5% → 42.0%, F1 46.6% → 63.5% 개선.
핵심 아이디어
Industrial-Instruction은 산업 기술 보고서의 이질적인 구조(밀집된 텍스트, 표, 명세서)를 고려해 QA 데이터셋을 생성하는 파이프라인을 제시한다. 기존 QA 데이터셋은 일반 문서에 집중되었으나, 산업 문서는 복잡한 구조와 분산된 정보로 인해 기존 파이프라인에서 효과적으로 추출 및 추론이 어려웠다. 이를 해결하기 위해 레이아웃 인식 추출(layout-aware extraction)를 적용하여 텍스트와 표 정보를 보존하고, 의미 기반 검색 인덱스를 구축한 후, 5가지 질의-문서 관계를 반영한 QA 쌍을 생성한다. 특히, Claude-Opus-4.6과 Qwen3-30B-A3B-Instruct 모델을 비교하면서 오픈 모델과 프론티어 모델의 데이터 생성 품질과 비용 효율성을 평가하는 새로운 접근을 제시한다.
기술적 접근법
- **데이터 수집**: 공개된 Panasonic 문서 906개 (총 7,525페이지) 사용.
- **레이아웃 인식 추출**: Dots.OCR을 활용한 텍스트 및 표 추출.
- **의미 기반 검색 인덱스**: FAISS와 Gemma3-300m 임베딩 모델을 사용.
- **QA 생성**: Qwen3-30B-A3B-Instruct와 Claude-Opus-4.6 모델로 QA 쌍 생성.
- **후처리**: 23.9k 샘플 중 13.6k QA 쌍 유지.
- **평가 모델**: Qwen-4B-Instruct, Phi-3-mini-4k, RAG-Instruct-Llama3-8B 사용.
- **RAG 구현**: 가장 기본적인 RAG 구조 적용.
주요 결과
- **Panasonic 벤치마크**: 10B 미만 파라미터 소형 모델에서 Industrial-Instruction 데이터셋을 사용한 미세 조정으로 Set-Match Accuracy 28.5% → 42.0%, F1 46.6% → 63.5% 개선.
- **데이터셋 품질 비교**: Claude-Opus-4.6 생성 데이터셋은 필터링률이 낮고, 미세 조정 효과가 더 크지만, 생성 비용은 Qwen3-30B-A3B-Instruct 대비 약 100배 높음.
- **MMLU 평가**: Claude-Opus-4.6 데이터셋으로 훈련된 모델은 일반 지식 유지율이 높으며, Qwen 생성 데이터셋은 소량의 forgetting 효과 관찰됨.
의의 및 한계
Industrial-Instruction은 산업 문서를 기반으로 한 QA 데이터셋 생성의 첫 번째 시도로, 산업 벤치마크와 훈련 데이터의 부족한 공급을 해결하는 실용적 접근을 제시한다. 특히, 오픈 모델(Qwen3-30B-A3B-Instruct)을 사용한 저비용 데이터셋 생성이 가능함을 보여주며, 이는 대규모 산업 데이터셋 구축에 중요한 단서를 제공한다. 그러나 실험에서 Claude-Opus-4.6 모델이 생성한 데이터셋이 품질 면에서 우수함을 보여주며, 품질-비용 간 균형이 필요하다는 한계도 드러난다. 또한, 현재 파이프라인은 질문 변형(perturbation)이나 재구성된 질문을 포함하지 않아 모델의 robustness 향상에 한계가 있다.
실용적 활용
Industrial-Instruction은 유지보수, 고장 진단, 제품 공학 등 산업 분야에서 실제 문서를 기반으로 한 QA 시스템 개발에 활용 가능하다. 특히, 소형 언어 모델(10B 미만 파라미터)을 사용한 저비용 훈련 데이터셋 생성이 가능하므로, 자원이 제한된 산업 현장에서 실용적이다. 또한, 오픈 모델을 활용한 데이터셋 생성은 비용 효율성을 높이고, 산업 내 지식 관리 시스템의 자동화를 촉진할 수 있다.