punten all, saya mau nanya dong. Jadikan sekarang saya lagi ngerjain skripsi terkait RAG. Nah di proses retrieval itu saya bagi dua (karena karakterisitk datanya beda) ada yang make embedding indobert, satu lagi karena datanya emang butuh exact saya make BM25. Nah untuk pengujian yang embedding ini cukup bingung.
Bingungnya dimana?
jadi kan untuk uji retrieval embedding, saya nyusun pertanyaan dan jawaban make ai biar meminimalkan data uji sama secara leksikal dengan data di corpus. untuk ngebandingin jawaban dari data uji ini (ground truth) dengan hasil retrieved dokumen dari korpus ini gimana yah?
kalo saya make Rouge buat bandingin, hasilnya jelek. asumsi saya karena Rouge bandingin exact pertoken jadinya kurang sesuai gitu karena ground truth tadi udah dimodifikasi biar gak sama leksikal tapi masih sama secara semantik.
Note. data di corpus cuman ada kalimat text gitu, gak ada id documentnya🙏
⚠️ Hai @Romiwhy, mohon lengkapi foto profil publik kamu untuk mematuhi aturan grup.
Kamu akan dibatasi setelah 3 pesan atau 5 menit.
📖 Baca aturan grup
🚫 @Romiwhy telah dibatasi karena tidak melengkapi profil dalam 5 menit.
📖 Baca aturan grup
✉️ Hubungi langsung robot untuk membuka pembatasan (mohon pertimbangkan bahwa percakapan dengan robot saat ini sebagian besar belum direkam)
Kalau task information retrieval pakai metrics information reteieval juga.
Jadi bukan bandingin ground truth jawaban dengan hasil retrieval, itu me campurkan metrics QA dengan IR. Jadi yg benar bandingin ekspektasi chunk retrieval dengan hasil retrieval, nnti bisa didapet precision, recall, accuracy, F1 nya
Sesuaikan metrics yg dipake dengan task nya
Tapi iya juga sih, dibeberapa paper, groud truthnya dipake buat judge generation dari LLMnya. Dan benar kalo IR make metric yg masa sebutin, ada lagi kayak MMR juga