بازشناسی متون فارسی با استفاده از مدل زبانی n-gram و پالایش گرامری
نویسنده:
چکیده:
بازشناسی متون، در سال های اخیر بسیار مورد توجه قرار گرفته است. ارائه الگوریتم های بازشناسی، برگرفته از ساختار گرامری و معنایی این زبان می تواند روش موثری در پردازش های دیگر مربوط به خط و زبان فارسی باشد. در این مقاله با استفاده از شاخه علمی پردازش زبان های طبیعی، یک الگوریتم سه مرحله ای به منظور بازشناسی متون فارسی بر مبنای بازشناسی جملات فارسی ارائه می شود. این روش شامل مراحل ترکیب زیرکلمات به منظور ساخت کلمات و سپس جملات بالقوه معنی دار و درنهایت استفاده از دو مدل زبانی و چند قاعده گرامری، به منظور تشخیص جمله صحیح براساس انطباق با گرامر زبان فارسی است.آزمایش های متعدد نشان می دهد که دقت روش ارائه شده برای مرحله ساخت کلمات و سپس جملات بالقوه معنی دار98 درصد و برای تشخیص جمله صحیح با استفاده از مدل زبانی بایگرام 85 درصد و برای مدل زبانی ترایگرام 88 درصد است.
کلیدواژگان:
زبان:
فارسی
در صفحه:
107
لینک کوتاه:
magiran.com/p1311114
دانلود و مطالعه متن این مقاله با یکی از روشهای زیر امکان پذیر است:
اشتراک شخصی
با عضویت و پرداخت آنلاین حق اشتراک یکساله به مبلغ 1,390,000ريال میتوانید 70 عنوان مطلب دانلود کنید!
اشتراک سازمانی
به کتابخانه دانشگاه یا محل کار خود پیشنهاد کنید تا اشتراک سازمانی این پایگاه را برای دسترسی نامحدود همه کاربران به متن مطالب تهیه نمایند!
توجه!
- حق عضویت دریافتی صرف حمایت از نشریات عضو و نگهداری، تکمیل و توسعه مگیران میشود.
- پرداخت حق اشتراک و دانلود مقالات اجازه بازنشر آن در سایر رسانههای چاپی و دیجیتال را به کاربر نمیدهد.
In order to view content subscription is required
Personal subscription
Subscribe magiran.com for 70 € euros via PayPal and download 70 articles during a year.
Organization subscription
Please contact us to subscribe your university or library for unlimited access!