۱۴۰۵-۰۵-۲۶ | ۰۳:۴۹
236148

زبان‌های کردی، لری، بلوچی، لکی و گیلکی در عصر هوش مصنوعی با کمبود داده مواجه‌اند


دیدگاه نیوز را به منابع منتخب خود در گوگل اضافه کنید

به گزارش دیدگاه نیوز، ورود زبان‌ها به مدل‌های هوش مصنوعی نیازمند مجموعه‌ای از منابع فنی از جمله پیکره‌های متنی، داده‌های گفتاری، فرهنگ‌های لغت دیجیتال و منابع آموزشی است. نبود این زیرساخت‌ها باعث می‌شود یک زبان زنده، در محیط‌های جدید فناوری حضور محدودی داشته باشد.

داده؛ زیرساخت حضور زبان‌ها در هوش مصنوعی

پردازش زبان طبیعی یا NLP بر پایه یادگیری از داده‌های زبانی انجام می‌شود. مدل‌های زبانی بزرگ مانند GPT و BERT با تحلیل حجم گسترده‌ای از متن، الگوهای واژگانی، نحوی و معنایی زبان را استخراج می‌کنند.

با این حال، توانایی تولید متن الزاماً به معنای درک کامل زبان نیست. این مسئله برای زبان‌هایی که منابع دیجیتال محدودتری دارند، پیچیده‌تر است؛ زیرا داده کافی برای ساخت مدل، ارزیابی عملکرد و توسعه ابزارهای کاربردی در دسترس نیست.

بر اساس برآوردهای موجود، فارسی با حدود ۵۰.۴ میلیون گویشور، بزرگ‌ترین زبان ایرانی است. پس از آن، کردی با حدود ۵.۵۹ میلیون، گیلکی با حدود ۲.۴ میلیون، مازندرانی با حدود ۲.۳۴ میلیون، بلوچی با حدود ۱.۹۲ میلیون، لری با حدود ۱.۷ میلیون و لکی با حدود یک میلیون گویشور قرار دارند؛ با این حال فاصله این زبان‌ها در حوزه فناوری زبان، بسیار بیشتر از فاصله جمعیتی آنهاست.

دیجیتال‌سازی؛ شرط حضور زبان‌ها در فناوری

زبان‌ها برای حضور در ابزارهایی مانند ترجمه ماشینی، دستیارهای صوتی، موتورهای جست‌وجو و سامانه‌های آموزشی هوشمند باید منابع ساختاریافته و قابل پردازش داشته باشند.

مطالعات حوزه پردازش زبان طبیعی نشان می‌دهد عملکرد مدل‌های هوش مصنوعی به‌شدت تحت تأثیر حجم و کیفیت داده‌های آموزشی قرار دارد. در یک مطالعه، عملکرد مدل‌ها برای زبان انگلیسی ۸۸ درصد، اسپانیایی ۶۲ درصد، ماندارین ۵۸ درصد و عربی ۵۴ درصد گزارش شده است.

این ارقام نشان می‌دهد کیفیت عملکرد هوش مصنوعی در زبان‌های مختلف یکسان نیست و داشتن جمعیت بزرگ گویشوران به‌تنهایی حضور یک زبان را در فناوری تضمین نمی‌کند.

تجربه زبان فارسی در ورود به هوش مصنوعی

در میان زبان‌های ایرانی، فارسی از نظر زیرساخت دیجیتال فاصله قابل توجهی با سایر زبان‌ها دارد. این وضعیت حاصل چند دهه تولید محتوای دیجیتال، فعالیت دانشگاهی، توسعه نرم‌افزارهای زبانی و ایجاد مجموعه داده‌های پردازشی است.

فارسی از منابعی مانند ParsBERT و FarsTail و همچنین منابع گفتاری مانند DeepMine برخوردار است. دیتاست DeepMine شامل بیش از یک هزار و ۸۵۰ گوینده، حدود ۵۴۰ هزار فایل صوتی و بیش از ۴۸۰ ساعت داده گفتاری رونویسی‌شده است.

تجربه فارسی نشان می‌دهد حتی زبانی با ده‌ها میلیون کاربر نیز برای ورود به فناوری هوش مصنوعی به سرمایه‌گذاری گسترده در تولید داده نیاز دارد.

کردی؛ چالش تنوع گونه‌ها و خط نوشتاری

کردی یکی از مهم‌ترین زبان‌های ایرانی از نظر تعداد گویشور و گستره جغرافیایی است و در ایران، عراق، ترکیه و سوریه استفاده می‌شود. گونه‌های اصلی آن شامل کرمانجی، سورانی و دیگر گونه‌های منطقه‌ای است.

با وجود جمعیت قابل توجه گویشوران، منابع فناوری زبان کردی با زبان‌های بزرگ جهانی فاصله زیادی دارد.

یکی از چالش‌های مهم این زبان، تنوع گونه‌ها و خط نوشتاری است. کردی کرمانجی عمدتاً با خط لاتین نوشته می‌شود، در حالی که کردی سورانی از خط عربی اصلاح‌شده استفاده می‌کند. این تفاوت باعث می‌شود داده‌های زبانی در مسیرهای جداگانه تولید شوند و ایجاد مدل‌های یکپارچه دشوارتر شود.

بلوچی؛ زبان زنده بدون زیرساخت فناورانه کافی

بلوچی یکی دیگر از زبان‌های ایرانی با گستره جغرافیایی وسیع است که در ایران، پاکستان و افغانستان استفاده می‌شود.

با وجود شمار قابل توجه گویشوران، توسعه منابع دیجیتال و ابزارهای پردازش زبان بلوچی متناسب با اندازه جامعه زبانی پیش نرفته است.

وضعیت منابع نوشتاری و استانداردسازی از جمله چالش‌های اصلی این زبان محسوب می‌شود. بخشی از محتوای بلوچی نیز در قالب‌های غیرساختاریافته قرار دارد؛ در حالی که برای توسعه مدل‌های زبانی، داده‌ها باید قابل پردازش، دسته‌بندی و استانداردسازی باشند.

گیلکی و مازندرانی؛ میراثی که باید به داده تبدیل شود

گیلکی و مازندرانی از زبان‌های ایرانی شمالی هستند که هر کدام میلیون‌ها گویشور دارند و از پیشینه ادبی، فرهنگی و شفاهی گسترده‌ای برخوردارند.

با این حال، بخش مهمی از این میراث هنوز در قالب منابع دیجیتال استاندارد برای فناوری زبان ثبت نشده است.

بخش قابل توجهی از داده‌های این زبان‌ها در گفت‌وگوهای روزمره، موسیقی، ادبیات شفاهی و محتوای شبکه‌های اجتماعی وجود دارد، اما برای آموزش مدل‌های هوش مصنوعی باید این داده‌ها به مجموعه‌های ساختاریافته تبدیل، برچسب‌گذاری و پردازش شوند.

لری و لکی؛ چالش میراث شفاهی

لری و لکی نیز از زبان‌های ایرانی هستند که بخش قابل توجهی از کاربرد روزمره آنها در حوزه گفتار اتفاق می‌افتد.

یکی از چالش‌های اصلی این زبان‌ها، نبود استاندارد نوشتاری فراگیر و وابستگی بخش زیادی از محتوای مکتوب به خط فارسی است. برای مدل‌های هوش مصنوعی، تشخیص تفاوت میان فارسی و گونه‌های نزدیک زبانی یا شناسایی ویژگی‌های مستقل یک زبان، نیازمند داده آموزشی کافی است.

نبود چنین داده‌هایی می‌تواند باعث شود بخشی از تنوع زبانی در داده‌های آموزشی مدل‌های هوش مصنوعی ناپدید شود.

هوش مصنوعی فقط واژه‌ها را یاد نمی‌گیرد

افزایش حجم داده به‌تنهایی برای حل مشکل کافی نیست. زبان تنها مجموعه‌ای از واژه‌ها نیست و معنا در بسیاری از موارد به زمینه اجتماعی، رابطه میان افراد، لحن و دانش فرهنگی وابسته است.

مدل‌های هوش مصنوعی در تولید متن منسجم، ساختار دستوری و سازمان‌دهی اطلاعات عملکرد بالایی دارند، اما همچنان در زمینه‌هایی مانند سازگاری با شرایط، درک نشانه‌های اجتماعی و تولید زبان طبیعی مشابه انسان با محدودیت مواجه‌اند.

این موضوع برای زبان‌های محلی اهمیت بیشتری دارد؛ زیرا بخش قابل توجهی از معنای آنها در اصطلاحات، ضرب‌المثل‌ها، کاربردهای اجتماعی، طنز و سایر عناصر غیررسمی زبان شکل می‌گیرد.

خطر شکل‌گیری شهروندان درجه دو زبانی

بسیاری از تعاملات آینده میان شهروندان و فناوری، از آموزش شخصی‌سازی‌شده و دستیارهای هوشمند گرفته تا خدمات عمومی و سامانه‌های سلامت، از طریق زبان انجام خواهد شد.

در چنین شرایطی، مسئله زبان‌های کم‌منبع صرفاً موضوعی فرهنگی یا مرتبط با میراث زبانی نیست. اگر یک زبان در سامانه‌های هوشمند حضور نداشته باشد، کاربران آن زبان در بسیاری از کاربردهای آینده ناچار خواهند بود از زبان دیگری استفاده کنند.

ایجاد بانک داده زبان‌های ایران ضروری است

ورود زبان‌های ایرانی به عصر هوش مصنوعی نیازمند ایجاد زیرساخت داده است. ایجاد پیکره‌های متنی، ثبت داده‌های صوتی، دیجیتال‌سازی کتاب‌ها و منابع دانشگاهی، ایجاد فرهنگ‌های لغت دیجیتال و جمع‌آوری نمونه‌های گفتاری می‌تواند پایه توسعه ابزارهای آینده باشد.

در ایران، مسئله تنها کمبود ابزارهای هوش مصنوعی نیست؛ پیش از آن، کمبود داده‌های استاندارد درباره بخشی از زبان‌های موجود کشور مطرح است. بدون سازوکار مشخص برای جمع‌آوری، نگهداری و دسترس‌پذیر کردن داده‌های زبانی، توسعه فناوری برای بسیاری از زبان‌های ایرانی به پروژه‌هایی پراکنده و محدود باقی خواهد ماند.

در عصر هوش مصنوعی، تنوع زبانی زمانی می‌تواند حفظ شود که از مرحله میراث فرهنگی عبور کند و به‌عنوان بخشی از زیرساخت فناوری کشور مورد توجه قرار گیرد. زبان‌هایی که امروز داده دیجیتال کافی ندارند، ممکن است فردا در مهم‌ترین لایه‌های ارتباط انسان و ماشین حضور نداشته باشند.

نظر شما در مورد این مطلب چیست؟ نظرات خود را در پایین همین صفحه با ما در میان بگذارید. 👇


دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *