سلام وقت بخیر
دوستان برای مقایسه دو فایل صوتی انگلیسی از نظر نحوه تلفظ مدل pretrain یا حداقل دیتاست که به این منظور ساخته شده باشه میشناسین (ورودی دو تا ویس و خروجی یک similarity score)؟
طبیعتا این مدل باید به دو تا ویس با متن و تلفظ یکسان score بالا، برای دو تا ویس با متن یکسان ولی تلفظ متفاوت score پایین و برای دو تا ویس با متن متفاوت score خیلی پایین بده