retrieval-augmented-generation bm25 nemotron retrieval-models lora-tuning faithfulness-citation hera-benchmark modern-greek
Abstract
Modern Greek is absent from NVIDIA's Nemotron retrieval models and from major multilingual retrieval benchmarks, despite being important for retrieval-augmented generation (RAG) in legal, energy, financial, and medical applications. We present an end-to-end adaptation of the Nemotron retrieval stack for Modern Greek, including corpus mining, synthetic supervision, retrieval model training, reranker adaptation, reader fine-tuning, and a new benchmark called HERA. Our study shows that a parameter-free BM25 baseline outperforms several off-the-shelf multilingual dense retrieval models on specialist Greek corpora. After fine-tuning on 65,773 Greek retrieval pairs, a Nemotron 1B embedder improves nDCG@10 from 0.362 to 0.835 and substantially outperforms its unadapted counterpart. The learned language competence transfers to general-domain Greek, although the advantage over BM25 remains domain-dependent. We further adapt a cross-encoder reranker and demonstrate consistent improvements across specialist domains. Finally, we LoRA-tune a Nemotron 30B-A3B mixture-of-experts reader for grounded generation, increasing judged answer correctness from 29.4% to 66.9% while significantly improving faithfulness and citation quality. We also introduce HERA, the first large-scale Greek benchmark for retrieval-augmented generation, and release our adapted models and benchmark to support future research on Greek-language RAG systems.
한국어 요약
한 줄 요약
현대 그리스어를 위한 Nemotron 검색 모델과 RAG 벤치마크 HERA를 구축하고 성능을 개선했다.
핵심 기여도
- Nemotron 검색 스택을 현대 그리스어로 엔드투엔드로 적응.
- 65,773개의 그리스어 검색 쌍을 사용해 Nemotron 1B 임베더의 nDCG@10을 0.362 → 0.835로 향상.
- LoRA 기반 Nemotron 30B-A3B 리더를 미세조정해 정답 정확도 29.4% → 66.9% 개선.
- HERA: 최초의 대규모 그리스어 RAG 벤치마크를 제안 및 공개.
핵심 아이디어
NVIDIA Nemotron 모델이 현대 그리스어를 지원하지 않아 법률, 에너지, 금융, 의료 등 전문 분야에서 RAG 활용이 제한되었다는 문제를 인식했다. 이에, Nemotron 검색 스택을 현대 그리스어에 맞게 엔드투엔드로 재구성하고, 합성 감독 데이터와 전문 분야 코퍼스를 활용해 모델을 미세조정했다. 특히, BM25 기반의 파라미터 없는 베이스라인이 전문 분야에서 기존 다국어 밀집 검색 모델보다 우수한 성능을 보임을 발견하고, 이를 바탕으로 Nemotron 임베더와 리랭커를 적응시켰다. 또한, 믿을 수 있는 생성을 위해 LoRA 기반의 리더 모델을 도입하여 인용 정확도를 크게 향상시켰다.
기술적 접근법
- **Corpus Mining**: 전문 분야(법률, 에너지, 금융, 의료)의 그리스어 코퍼스를 수집.
- **Synthetic Supervision**: 65,773개의 검색 쌍을 생성해 Nemotron 1B 임베더 미세조정.
- **Reranker Adaptation**: Cross-encoder 기반 리랭커를 적응.
- **Reader Fine-tuning**: LoRA를 사용한 Nemotron 30B-A3B 리더 모델 미세조정.
- **HERA Benchmark**: 전문 분야와 일반 분야를 포함한 대규모 RAG 평가 데이터셋 구축.
주요 결과
- Nemotron 1B 임베더의 nDCG@10: 0.362 → 0.835 (65,773개 쌍 기반 미세조정).
- LoRA 기반 Nemotron 30B-A3B 리더: 정답 정확도 29.4% → 66.9% (HERA 기준).
- BM25 베이스라인은 전문 분야에서 기존 다국어 밀집 모델보다 우수한 성능 보임.
- 미세조정된 Nemotron 모델은 일반 도메인에서도 성능 이전.
의의 및 한계
이 연구는 현대 그리스어를 위한 첫 RAG 스택 구축을 통해 법률, 의료 등 전문 분야에서의 정보 검색 및 생성을 가능하게 한다는 점에서 학술적·실용적 의의가 있다. 특히, HERA 벤치마크는 향후 연구를 위한 중요한 기초 자료가 될 것이다. 그러나 모델의 성능은 도메인에 따라 변동이 크며, BM25 대비의 상대적 우위는 여전히 도메인 의존적이라는 한계가 있다. 또한, 공개된 데이터셋의 범위와 질이 모델 성능에 큰 영향을 미친다는 점도 지적된다.
실용적 활용
이 연구는 법률, 의료, 금융, 에너지 등 전문 분야에서 현대 그리스어를 사용하는 기업과 연구소에 RAG 기반의 정보 검색 및 생성 시스템 구축에 활용될 수 있다. 특히, HERA 벤치마크는 해당 분야의 모델 평가 및 개선에 기초 자료로 쓰일 수 있다.