روشی جدید در تشخیص تکراری رکوردها با استفاده از خوشه بندی سلسله مراتبی
به دلیل اهمیت بالای کیفیت داده ها در عملکرد سامانه های نرم افزاری، فرآیند پاکسازی داده به خصوص تشخیص رکوردهای تکراری، طی سالیان اخیر یکی از مهم ترین حوزه های علوم رایانه به حساب آمده است. در این مقاله روشی برای تشخیص رکوردهای تکراری ارایه شده است که با خوشه بندی سلسله مراتبی رکوردها بر اساس ویژگی های مناسب در هر سطح، میزان شباهت میان رکوردها تخمین زده می شود. این کار سبب می شود تا خوشه هایی در سطح آخر به دست آیند که رکوردهای درون آن ها بسیار مشابه یکدیگر باشند. برای کشف رکوردهای تکراری نیز مقایسه تنها بر روی رکوردهای درون یک خوشه از سطح آخر انجام می گیرد. همچنین در این مقاله برای مقایسه میان رکوردها، یک تابع تشابه نسبی بر پایه تابع فاصله ویرایشی ارایه شده که دقت بسیار بالایی به همراه دارد. مقایسه نتایج ارزیابی سامانه نشان می دهد که روش ارایه شده، در زمان کمتری، 90% تکراری های موجود را با دقت 97% کشف می کند و بهبود داشته است.
- حق عضویت دریافتی صرف حمایت از نشریات عضو و نگهداری، تکمیل و توسعه مگیران میشود.
- پرداخت حق اشتراک و دانلود مقالات اجازه بازنشر آن در سایر رسانههای چاپی و دیجیتال را به کاربر نمیدهد.