Implementasi Sistem Tanya Jawab Dokumen Regulasi Berbasis RAG dengan Pencarian Semantik dan Normalisasi Typo Levenshtein

Syahira Elfiandani Nasution, M Fakhriza

Abstract


Penelitian ini mengimplementasikan sistem tanya jawab dokumen regulasi berbasis Retrieval-Augmented Generation (RAG) yang memadukan pencarian semantik berbasis cosine similarity dengan normalisasi kesalahan ketik menggunakan Levenshtein distance. Dokumen PDF diekstraksi per halaman, dipotong hingga 3.000 karakter, direpresentasikan menggunakan model gemini-embedding-001 dengan dimensi keluaran 768, dan disimpan sebagai vektor JSON pada MySQL. Kueri pengguna dinormalisasi menggunakan kamus dinamis dari korpus, kemudian kandidat halaman diperingkat berdasarkan cosine similarity, keyword boost 0,25, dan fallback pencarian LIKE ketika skor tertinggi kurang dari 0,2. Konteks terpilih diteruskan ke Gemini API untuk menghasilkan jawaban beserta nama dokumen dan nomor halaman. Pengujian fungsional menunjukkan bahwa autentikasi, unggah dan ekstraksi dokumen, pembentukan embedding, retrieval, generasi jawaban berbasis konteks, dan penyajian rujukan berjalan sesuai rancangan. Simulasi perhitungan memperlihatkan cara keyword boost mengubah urutan kandidat dan Levenshtein distance menormalkan “pasword” menjadi “password”. Temuan ini menunjukkan kelayakan implementasi pipeline, tetapi belum membuktikan peningkatan akurasi retrieval karena belum tersedia dataset pertanyaan berlabel, baseline, ablation, dan evaluasi kuantitatif.

Keywords


Hybrid Retrieval; Retrieval-Augmented Generation; Cosine Similarity; Levenshtein Distance; Gemini API

Full Text:

PDF

References


J. Devlin, M.-W. Chang, K. Lee, and K. Toutanova, “BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding,” in Proc. NAACL-HLT, pp. 4171–4186, 2019.

A. Vaswani, N. Shazeer, N. Parmar, et al., “Attention Is All You Need,” in Advances in Neural Information Processing Systems 30, 2017.

Y. Gao, Y. Xiong, X. Gao, K. Jia, J. Pan, Y. Bi, Y. Dai, J. Sun, M. Wang, and H. Wang, “Retrieval-Augmented Generation for Large Language Models: A Survey,” arXiv preprint arXiv:2312.10997, 2023.

B. Ni, Z. Liu, L. Wang, Y. Lei, Y. Zhao, X. Cheng, Q. Zeng, L. Dong, Y. Xia, Y. Fan, et al., “Towards Trustworthy Retrieval Augmented Generation for Large Language Models: A Survey,” arXiv preprint arXiv:2502.06872, 2025.

I. K. W. Adnyana, R. T. Tayane, F. Fahmi, F. Wicaksono, B. Nugraha, and E. Y. Ali, “Mitigating Hallucinations in Large Language Models via Retrieval Augmented Generation: A Systematic Review of n8n-Based Implementations,” EDUKASIA, vol. 7, no. 1, pp. 605–618, 2026.

P. Lewis, E. Perez, A. Piktus, F. Petroni, V. Karpukhin, N. Goyal, H. Küttler, M. Lewis, W.-t. Yih, T. Rocktäschel, S. Riedel, and D. Kiela, “Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks,” in Advances in Neural Information Processing Systems 33, 2020.

N. Reimers and I. Gurevych, “Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks,” in Proc. 2019 Conf. Empirical Methods in Natural Language Processing, 2019.

J. Pardede and A. Yudistira, “Comparison of Cosine Similarity, Rabin-Karp, and Levenshtein Distance Algorithms for Plagiarism Detection in Document,” Ultimatics: Jurnal Teknik Informatika, vol. 17, no. 1, pp. 63–71, 2025.

J. Juvekar and A. Purwar, “COS-Mix: Cosine Similarity and Distance Fusion for Improved Information Retrieval,” arXiv preprint arXiv:2406.00638, 2024.

S. Es, J. James, L. Espinosa-Anke, and S. Schockaert, “RAGAS: Automated Evaluation of Retrieval Augmented Generation,” arXiv preprint arXiv:2309.15217, 2023.




DOI: http://dx.doi.org/10.30829/jistech.v11i2.31523

Refbacks

  • There are currently no refbacks.



Current Indexing

 

Creative Commons License

Creative Commons License
This work is licensed under a Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International License.