به گزارش دیدگاه نیوز، ورود زبانها به مدلهای هوش مصنوعی نیازمند مجموعهای از منابع فنی از جمله پیکرههای متنی، دادههای گفتاری، فرهنگهای لغت دیجیتال و منابع آموزشی است. نبود این زیرساختها باعث میشود یک زبان زنده، در محیطهای جدید فناوری حضور محدودی داشته باشد.
داده؛ زیرساخت حضور زبانها در هوش مصنوعی
پردازش زبان طبیعی یا NLP بر پایه یادگیری از دادههای زبانی انجام میشود. مدلهای زبانی بزرگ مانند GPT و BERT با تحلیل حجم گستردهای از متن، الگوهای واژگانی، نحوی و معنایی زبان را استخراج میکنند.
با این حال، توانایی تولید متن الزاماً به معنای درک کامل زبان نیست. این مسئله برای زبانهایی که منابع دیجیتال محدودتری دارند، پیچیدهتر است؛ زیرا داده کافی برای ساخت مدل، ارزیابی عملکرد و توسعه ابزارهای کاربردی در دسترس نیست.
بر اساس برآوردهای موجود، فارسی با حدود ۵۰.۴ میلیون گویشور، بزرگترین زبان ایرانی است. پس از آن، کردی با حدود ۵.۵۹ میلیون، گیلکی با حدود ۲.۴ میلیون، مازندرانی با حدود ۲.۳۴ میلیون، بلوچی با حدود ۱.۹۲ میلیون، لری با حدود ۱.۷ میلیون و لکی با حدود یک میلیون گویشور قرار دارند؛ با این حال فاصله این زبانها در حوزه فناوری زبان، بسیار بیشتر از فاصله جمعیتی آنهاست.
دیجیتالسازی؛ شرط حضور زبانها در فناوری
زبانها برای حضور در ابزارهایی مانند ترجمه ماشینی، دستیارهای صوتی، موتورهای جستوجو و سامانههای آموزشی هوشمند باید منابع ساختاریافته و قابل پردازش داشته باشند.
مطالعات حوزه پردازش زبان طبیعی نشان میدهد عملکرد مدلهای هوش مصنوعی بهشدت تحت تأثیر حجم و کیفیت دادههای آموزشی قرار دارد. در یک مطالعه، عملکرد مدلها برای زبان انگلیسی ۸۸ درصد، اسپانیایی ۶۲ درصد، ماندارین ۵۸ درصد و عربی ۵۴ درصد گزارش شده است.
این ارقام نشان میدهد کیفیت عملکرد هوش مصنوعی در زبانهای مختلف یکسان نیست و داشتن جمعیت بزرگ گویشوران بهتنهایی حضور یک زبان را در فناوری تضمین نمیکند.
تجربه زبان فارسی در ورود به هوش مصنوعی
در میان زبانهای ایرانی، فارسی از نظر زیرساخت دیجیتال فاصله قابل توجهی با سایر زبانها دارد. این وضعیت حاصل چند دهه تولید محتوای دیجیتال، فعالیت دانشگاهی، توسعه نرمافزارهای زبانی و ایجاد مجموعه دادههای پردازشی است.
فارسی از منابعی مانند ParsBERT و FarsTail و همچنین منابع گفتاری مانند DeepMine برخوردار است. دیتاست DeepMine شامل بیش از یک هزار و ۸۵۰ گوینده، حدود ۵۴۰ هزار فایل صوتی و بیش از ۴۸۰ ساعت داده گفتاری رونویسیشده است.
تجربه فارسی نشان میدهد حتی زبانی با دهها میلیون کاربر نیز برای ورود به فناوری هوش مصنوعی به سرمایهگذاری گسترده در تولید داده نیاز دارد.
کردی؛ چالش تنوع گونهها و خط نوشتاری
کردی یکی از مهمترین زبانهای ایرانی از نظر تعداد گویشور و گستره جغرافیایی است و در ایران، عراق، ترکیه و سوریه استفاده میشود. گونههای اصلی آن شامل کرمانجی، سورانی و دیگر گونههای منطقهای است.
با وجود جمعیت قابل توجه گویشوران، منابع فناوری زبان کردی با زبانهای بزرگ جهانی فاصله زیادی دارد.
یکی از چالشهای مهم این زبان، تنوع گونهها و خط نوشتاری است. کردی کرمانجی عمدتاً با خط لاتین نوشته میشود، در حالی که کردی سورانی از خط عربی اصلاحشده استفاده میکند. این تفاوت باعث میشود دادههای زبانی در مسیرهای جداگانه تولید شوند و ایجاد مدلهای یکپارچه دشوارتر شود.
بلوچی؛ زبان زنده بدون زیرساخت فناورانه کافی
بلوچی یکی دیگر از زبانهای ایرانی با گستره جغرافیایی وسیع است که در ایران، پاکستان و افغانستان استفاده میشود.
با وجود شمار قابل توجه گویشوران، توسعه منابع دیجیتال و ابزارهای پردازش زبان بلوچی متناسب با اندازه جامعه زبانی پیش نرفته است.
وضعیت منابع نوشتاری و استانداردسازی از جمله چالشهای اصلی این زبان محسوب میشود. بخشی از محتوای بلوچی نیز در قالبهای غیرساختاریافته قرار دارد؛ در حالی که برای توسعه مدلهای زبانی، دادهها باید قابل پردازش، دستهبندی و استانداردسازی باشند.
گیلکی و مازندرانی؛ میراثی که باید به داده تبدیل شود
گیلکی و مازندرانی از زبانهای ایرانی شمالی هستند که هر کدام میلیونها گویشور دارند و از پیشینه ادبی، فرهنگی و شفاهی گستردهای برخوردارند.
با این حال، بخش مهمی از این میراث هنوز در قالب منابع دیجیتال استاندارد برای فناوری زبان ثبت نشده است.
بخش قابل توجهی از دادههای این زبانها در گفتوگوهای روزمره، موسیقی، ادبیات شفاهی و محتوای شبکههای اجتماعی وجود دارد، اما برای آموزش مدلهای هوش مصنوعی باید این دادهها به مجموعههای ساختاریافته تبدیل، برچسبگذاری و پردازش شوند.
لری و لکی؛ چالش میراث شفاهی
لری و لکی نیز از زبانهای ایرانی هستند که بخش قابل توجهی از کاربرد روزمره آنها در حوزه گفتار اتفاق میافتد.
یکی از چالشهای اصلی این زبانها، نبود استاندارد نوشتاری فراگیر و وابستگی بخش زیادی از محتوای مکتوب به خط فارسی است. برای مدلهای هوش مصنوعی، تشخیص تفاوت میان فارسی و گونههای نزدیک زبانی یا شناسایی ویژگیهای مستقل یک زبان، نیازمند داده آموزشی کافی است.
نبود چنین دادههایی میتواند باعث شود بخشی از تنوع زبانی در دادههای آموزشی مدلهای هوش مصنوعی ناپدید شود.
هوش مصنوعی فقط واژهها را یاد نمیگیرد
افزایش حجم داده بهتنهایی برای حل مشکل کافی نیست. زبان تنها مجموعهای از واژهها نیست و معنا در بسیاری از موارد به زمینه اجتماعی، رابطه میان افراد، لحن و دانش فرهنگی وابسته است.
مدلهای هوش مصنوعی در تولید متن منسجم، ساختار دستوری و سازماندهی اطلاعات عملکرد بالایی دارند، اما همچنان در زمینههایی مانند سازگاری با شرایط، درک نشانههای اجتماعی و تولید زبان طبیعی مشابه انسان با محدودیت مواجهاند.
این موضوع برای زبانهای محلی اهمیت بیشتری دارد؛ زیرا بخش قابل توجهی از معنای آنها در اصطلاحات، ضربالمثلها، کاربردهای اجتماعی، طنز و سایر عناصر غیررسمی زبان شکل میگیرد.
خطر شکلگیری شهروندان درجه دو زبانی
بسیاری از تعاملات آینده میان شهروندان و فناوری، از آموزش شخصیسازیشده و دستیارهای هوشمند گرفته تا خدمات عمومی و سامانههای سلامت، از طریق زبان انجام خواهد شد.
در چنین شرایطی، مسئله زبانهای کممنبع صرفاً موضوعی فرهنگی یا مرتبط با میراث زبانی نیست. اگر یک زبان در سامانههای هوشمند حضور نداشته باشد، کاربران آن زبان در بسیاری از کاربردهای آینده ناچار خواهند بود از زبان دیگری استفاده کنند.
ایجاد بانک داده زبانهای ایران ضروری است
ورود زبانهای ایرانی به عصر هوش مصنوعی نیازمند ایجاد زیرساخت داده است. ایجاد پیکرههای متنی، ثبت دادههای صوتی، دیجیتالسازی کتابها و منابع دانشگاهی، ایجاد فرهنگهای لغت دیجیتال و جمعآوری نمونههای گفتاری میتواند پایه توسعه ابزارهای آینده باشد.
در ایران، مسئله تنها کمبود ابزارهای هوش مصنوعی نیست؛ پیش از آن، کمبود دادههای استاندارد درباره بخشی از زبانهای موجود کشور مطرح است. بدون سازوکار مشخص برای جمعآوری، نگهداری و دسترسپذیر کردن دادههای زبانی، توسعه فناوری برای بسیاری از زبانهای ایرانی به پروژههایی پراکنده و محدود باقی خواهد ماند.
در عصر هوش مصنوعی، تنوع زبانی زمانی میتواند حفظ شود که از مرحله میراث فرهنگی عبور کند و بهعنوان بخشی از زیرساخت فناوری کشور مورد توجه قرار گیرد. زبانهایی که امروز داده دیجیتال کافی ندارند، ممکن است فردا در مهمترین لایههای ارتباط انسان و ماشین حضور نداشته باشند.
نظر شما در مورد این مطلب چیست؟ نظرات خود را در پایین همین صفحه با ما در میان بگذارید. 👇

بدون نظر! اولین نفر باشید