۱۴۰۵-۰۷-۱۱ | ۲۲:۱۲
238441

رونمایی از Qwen۳.۸-Max؛ مدل ۲.۴ تریلیون پارامتری علی‌بابا با پنجره یک میلیون توکنی

شرکت علی‌بابا از مدل هوش مصنوعی جدید خود با نام Qwen3.8-Max رونمایی کرده است؛ مدلی با مقیاس ۲.۴ تریلیون پارامتر که از معماری ترکیبی و پنجره زمینه تا یک میلیون توکن پشتیبانی می‌کند و برای کارهایی مانند استدلال پیچیده، برنامه‌نویسی، پژوهش، پردازش اطلاعات و انجام وظایف طولانی‌مدت توسعه یافته است.


دیدگاه نیوز را به منابع منتخب خود در گوگل اضافه کنید

به گزارش دیدگاه نیوز، شرکت علی‌بابا در سوم اوت ۲۰۲۶ از Qwen3.۸-Max به عنوان یکی از جدیدترین مدل‌های پرچمدار خانواده Qwen رونمایی کرد. این مدل در ادامه مسیر توسعه مدل‌های زبانی و چندوجهی علی‌بابا قرار دارد و با هدف پردازش وظایف پیچیده، استدلال چندمرحله‌ای، کدنویسی، پژوهش و انجام کارهای طولانی‌مدت توسعه یافته است.

بر اساس اعلام رسمی علی‌بابا، Qwen3.۸-Max دارای ۲.۴ تریلیون پارامتر است و از پنجره زمینه‌ای تا یک میلیون توکن پشتیبانی می‌کند. این مدل همچنین یک مدل پایه چندوجهی محسوب می‌شود و قابلیت پردازش اطلاعات بصری را نیز دارد.

عرضه این مدل نشان می‌دهد که توسعه مدل‌های هوش مصنوعی در سال ۲۰۲۶ همچنان بر افزایش توانایی استدلال، پردازش ورودی‌های طولانی، استفاده از ابزارها و انجام وظایف چندمرحله‌ای متمرکز است.

مشخصات فنی Qwen3.۸-Max

تعداد ۲.۴ تریلیون پارامتر یکی از مهم‌ترین اعداد اعلام‌شده درباره این مدل است. البته تعداد پارامتر به تنهایی معیار کاملی برای سنجش کیفیت یک مدل هوش مصنوعی نیست و معماری، داده‌های آموزشی، روش آموزش، توانایی استفاده از ابزارها، طول زمینه و عملکرد مدل در آزمون‌های واقعی نیز اهمیت دارند.

۲.۴ تریلیون پارامتر به چه معناست؟

پارامترها اجزای قابل تنظیم یک مدل یادگیری ماشین هستند که در جریان آموزش تغییر می‌کنند و به مدل اجازه می‌دهند الگوهای موجود در داده‌ها را یاد بگیرد. در مدل‌های زبانی بزرگ، تعداد پارامترها معمولاً یکی از شاخص‌هایی است که برای بیان مقیاس مدل مورد استفاده قرار می‌گیرد.

با این حال، افزایش تعداد پارامترها الزاماً به معنای افزایش متناسب کیفیت پاسخ‌ها نیست. مدل‌های جدیدتر می‌توانند با استفاده از معماری‌های کارآمدتر، فعال‌سازی بخشی از پارامترها در هر مرحله و روش‌های آموزشی پیشرفته، عملکرد قابل توجهی داشته باشند.

Qwen3.۸-Max نیز از معماری Sparse Mixture of Experts یا MoE بهره می‌برد. در این نوع معماری، همه بخش‌های مدل برای هر توکن لزوماً به صورت همزمان فعال نمی‌شوند و بخش‌های تخصصی‌تر مدل می‌توانند برای پردازش ورودی انتخاب شوند.

معماری Sparse Mixture of Experts چیست؟

معماری Mixture of Experts یا «ترکیب متخصص‌ها» یکی از روش‌هایی است که برای ساخت مدل‌های بسیار بزرگ مورد استفاده قرار می‌گیرد. ایده اصلی این معماری آن است که مدل به مجموعه‌ای از بخش‌های تخصصی تقسیم شود و برای هر ورودی، بخش‌های مناسب‌تر فعال شوند.

در مدل‌های Sparse، تمام ظرفیت مدل در هر مرحله مورد استفاده قرار نمی‌گیرد. این رویکرد می‌تواند به توسعه مدل‌هایی با تعداد پارامتر بسیار بالا کمک کند، بدون آنکه هزینه محاسباتی هر عملیات الزاماً به اندازه کل تعداد پارامترها افزایش پیدا کند.

علی‌بابا اعلام کرده است که Qwen3.۸-Max بر پایه معماری Sparse Mixture of Experts و یک سازوکار توجه ترکیبی ساخته شده است. این طراحی برای ایجاد تعادل میان مقیاس بسیار بزرگ مدل و کارایی محاسباتی آن به کار گرفته شده است.

رونمایی علی‌بابا از مدل هوش مصنوعی Qwen3.8-Max

پنجره زمینه یک میلیون توکنی چه اهمیتی دارد؟

یکی از ویژگی‌های مهم Qwen3.۸-Max پشتیبانی از پنجره زمینه تا یک میلیون توکن است. پنجره زمینه به مقدار اطلاعاتی گفته می‌شود که مدل می‌تواند در یک تعامل یا یک وظیفه در اختیار داشته باشد و هنگام تولید پاسخ به آن مراجعه کند.

هرچه این پنجره بزرگ‌تر باشد، مدل می‌تواند حجم بیشتری از متن یا اطلاعات را در یک فرآیند پردازش کند. این قابلیت برای کارهایی مانند بررسی اسناد طولانی، تحلیل مجموعه‌ای از فایل‌ها، مطالعه کدهای بزرگ، پژوهش‌های چندمرحله‌ای و پردازش محتوای گسترده اهمیت دارد.

برای مثال، یک پژوهشگر می‌تواند مجموعه بزرگی از اسناد را در اختیار مدل قرار دهد و از آن بخواهد میان بخش‌های مختلف ارتباط برقرار کند. یک برنامه‌نویس نیز می‌تواند پروژه‌ای با فایل‌های متعدد را در یک زمینه طولانی‌تر به مدل ارائه کند.

البته طولانی بودن پنجره زمینه به خودی خود تضمین نمی‌کند که مدل در تمام بخش‌های یک ورودی بسیار طولانی، عملکرد یکسانی داشته باشد. کیفیت بازیابی اطلاعات مرتبط و نحوه پردازش زمینه نیز در نتیجه نهایی اهمیت دارد.

Qwen3.۸-Max در چه کارهایی کاربرد دارد؟

علی‌بابا Qwen3.۸-Max را برای مجموعه‌ای از وظایف پیشرفته معرفی کرده است. کدنویسی، انجام کارهای واقعی و چندمرحله‌ای، پژوهش، استدلال و وظایفی که به تعامل طولانی نیاز دارند، از جمله کاربردهای اعلام‌شده برای این مدل هستند.

کدنویسی و توسعه نرم‌افزار

مدل‌های زبانی بزرگ در سال‌های اخیر به ابزار مهمی برای برنامه‌نویسان تبدیل شده‌اند. تولید قطعه‌کد، توضیح کدهای موجود، پیدا کردن خطاها، پیشنهاد راهکار برای مسائل برنامه‌نویسی و کمک به مستندسازی از جمله کاربردهای رایج این مدل‌هاست.

پنجره زمینه طولانی Qwen3.۸-Max می‌تواند برای پروژه‌هایی که شامل فایل‌های متعدد و کدهای طولانی هستند اهمیت داشته باشد. در چنین شرایطی، مدل می‌تواند اطلاعات بیشتری از ساختار پروژه را در اختیار داشته باشد و ارتباط میان بخش‌های مختلف را بهتر دنبال کند.

پژوهش و تحلیل اطلاعات

پژوهش یکی دیگر از حوزه‌هایی است که به مدل‌های دارای زمینه طولانی نیاز دارد. تحلیل چند سند، مقایسه اطلاعات، استخراج نکات مشترک و تهیه گزارش از مجموعه‌ای از منابع می‌تواند از جمله کاربردهای چنین مدلی باشد.

البته استفاده پژوهشی از مدل‌های هوش مصنوعی همچنان به بررسی منابع اصلی نیاز دارد. حتی مدل‌های پیشرفته نیز ممکن است اطلاعات نادرست تولید کنند یا در تفسیر یک منبع دچار خطا شوند. بنابراین خروجی مدل نباید بدون بررسی انسانی به عنوان منبع قطعی علمی یا خبری مورد استفاده قرار گیرد.

وظایف طولانی‌مدت

یکی از حوزه‌هایی که علی‌بابا روی آن تأکید کرده، انجام وظایف طولانی‌مدت است. تفاوت میان یک چت‌بات ساده و یک سیستم هوش مصنوعی عامل‌محور در همین بخش بیشتر دیده می‌شود؛ زیرا در وظایف طولانی، مدل باید بتواند چند مرحله را دنبال کند، نتیجه مراحل قبلی را در نظر بگیرد و در ادامه کار تصمیم‌های بعدی را اتخاذ کند.

این قابلیت می‌تواند در پروژه‌های تحقیقاتی، تولید محتوا، تحلیل داده، برنامه‌نویسی و برخی فرایندهای کاری مورد استفاده قرار گیرد.

قابلیت‌های چندوجهی Qwen3.۸-Max

Qwen3.۸-Max تنها به پردازش متن محدود نیست. علی‌بابا این مدل را یک مدل پایه چندوجهی معرفی کرده که قابلیت‌های هوش بصری نیز دارد. این ویژگی به مدل اجازه می‌دهد در کنار متن، اطلاعات بصری را نیز در فرایند پردازش وارد کند.

مدل‌های چندوجهی می‌توانند برای تحلیل تصاویر، درک محتوای تصویری، ترکیب داده‌های متنی و بصری و انجام وظایفی که نیازمند درک همزمان چند نوع ورودی هستند مورد استفاده قرار گیرند.

این روند در صنعت هوش مصنوعی اهمیت زیادی پیدا کرده است؛ زیرا تعامل انسان با اطلاعات تنها به متن محدود نیست و تصویر، ویدئو، صوت و داده‌های ساختاریافته نیز بخش مهمی از اطلاعات روزمره را تشکیل می‌دهند.

Qwen3.۸-Max در برابر نسل‌های قبلی Qwen

خانواده Qwen طی سال‌های گذشته به یکی از مجموعه‌های شناخته‌شده مدل‌های هوش مصنوعی علی‌بابا تبدیل شده است. پیش از Qwen3.۸-Max نیز مدل‌هایی مانند Qwen2.۵ و نسخه‌های مختلف آن در اختیار توسعه‌دهندگان قرار گرفته بودند.

دیدگاه نیوز پیش‌تر در گزارشی به نسخه Qwen2.۵-Max علی‌بابا پرداخته بود؛ مدلی که در آن زمان در فضای رقابتی میان مدل‌های هوش مصنوعی چین و شرکت‌های آمریکایی مورد توجه قرار گرفت.

Qwen3.۸-Max از نظر مقیاس و ظرفیت زمینه، گام جدیدی در مسیر توسعه این خانواده محسوب می‌شود. البته مقایسه مستقیم عملکرد آن با مدل‌های قبلی باید بر اساس آزمون‌های یکسان و نتایج قابل تکرار انجام شود.

Qwen3.۸-Max و رقابت جهانی مدل‌های هوش مصنوعی

بازار مدل‌های هوش مصنوعی در سال‌های اخیر به عرصه رقابت میان شرکت‌های متعددی تبدیل شده است. شرکت‌هایی مانند علی‌بابا، OpenAI، Google، Anthropic و مجموعه‌های دیگر مدل‌های بزرگ و چندوجهی خود را توسعه داده‌اند.

عرضه Qwen3.۸-Max نیز در همین فضای رقابتی انجام شده است. علی‌بابا در معرفی رسمی خود، توانایی‌های این مدل در زمینه کدنویسی، پژوهش، کارهای واقعی و وظایف طولانی‌مدت را برجسته کرده است.

در چنین شرایطی، تعداد پارامترها تنها یکی از معیارهای مقایسه مدل‌هاست. کیفیت خروجی، سرعت، هزینه استفاده، قابلیت‌های چندوجهی، طول زمینه، ابزارهای قابل استفاده، دسترسی API و نتایج آزمون‌های استاندارد نیز باید هنگام مقایسه مورد توجه قرار گیرند.

برای آشنایی بیشتر با فضای رقابت میان دستیارهای هوش مصنوعی، می‌توانید گزارش مقایسه کلود و ChatGPT را نیز در دیدگاه نیوز مطالعه کنید.

دسترسی به Qwen3.۸-Max چگونه است؟

بر اساس اعلام رسمی علی‌بابا، Qwen3.۸-Max از طریق APIهای Alibaba Cloud Model Studio برای توسعه‌دهندگان در سراسر جهان قابل دسترسی است. این مدل همچنین در پلتفرم QwenWork برای استفاده‌های کاری ارائه شده است.

این نکته اهمیت دارد، زیرا مدل‌های بسیار بزرگ الزاماً برای اجرای مستقیم روی رایانه شخصی طراحی نشده‌اند. در بسیاری از موارد، پردازش مدل‌های عظیم در زیرساخت‌های ابری انجام می‌شود و کاربر از طریق API یا یک سرویس آنلاین به مدل دسترسی پیدا می‌کند.

بنابراین عدد ۲.۴ تریلیون پارامتر نباید به این معنا برداشت شود که کاربران عادی می‌توانند چنین مدلی را به سادگی روی یک رایانه شخصی اجرا کنند. اجرای مدل‌های بسیار بزرگ به منابع سخت‌افزاری و زیرساخت محاسباتی قابل توجهی نیاز دارد.

آیا Qwen3.۸-Max متن‌باز است؟

در مورد خانواده Qwen3.۸ باید میان نسخه‌های مختلف تفاوت قائل شد. Qwen3.۸-Max به عنوان سرویس پرچمدار علی‌بابا معرفی شده است و نباید اطلاعات مربوط به مدل‌های دیگری از خانواده Qwen3.۸ را بدون بررسی به آن نسبت داد.

گزارش‌های فنی منتشرشده پس از معرفی این خانواده نشان می‌دهند که علی‌بابا مدل‌های دیگری را نیز با نام Qwen3.۸ عرضه کرده است؛ اما مدل Max و نسخه‌های قابل دریافت از خانواده Qwen3.۸ لزوماً یک محصول واحد با مشخصات و شرایط دسترسی یکسان نیستند.

به همین دلیل، هنگام دانلود یا استفاده از یک مدل Qwen3.۸ باید نام دقیق مدل، نسخه، مجوز و شیوه ارائه آن بررسی شود. این موضوع به‌خصوص برای توسعه‌دهندگانی که قصد استفاده تجاری یا اجرای محلی مدل را دارند اهمیت دارد.

یک میلیون توکن برای چه پروژه‌هایی مفید است؟

پنجره زمینه یک میلیون توکنی می‌تواند برای پروژه‌هایی که حجم اطلاعات بسیار زیادی دارند مفید باشد. تصور کنید یک شرکت بخواهد مجموعه‌ای از اسناد داخلی، دستورالعمل‌ها، گزارش‌ها و اطلاعات فنی را در اختیار یک سامانه هوش مصنوعی قرار دهد.

در مدل‌هایی با زمینه کوتاه‌تر، معمولاً لازم است اطلاعات به بخش‌های کوچک‌تر تقسیم شود. اما پنجره زمینه بزرگ‌تر امکان پردازش حجم بیشتری از اطلاعات را در یک تعامل فراهم می‌کند.

این قابلیت در تحلیل قراردادها، مستندات فنی، پایگاه‌های دانش، پروژه‌های نرم‌افزاری، گزارش‌های پژوهشی و تولید محتوای مبتنی بر منابع متعدد می‌تواند کاربرد داشته باشد.

البته استفاده عملی از زمینه بسیار طولانی به طراحی مناسب سامانه، هزینه پردازش و روش مدیریت اطلاعات نیز وابسته است. در بسیاری از پروژه‌ها، استفاده از بازیابی اطلاعات و ارسال تنها بخش‌های مرتبط می‌تواند همچنان روش کارآمدتری باشد.

آیا پارامتر بیشتر یعنی هوش مصنوعی بهتر؟

تعداد پارامترهای یک مدل، اطلاعاتی درباره مقیاس آن ارائه می‌دهد اما به تنهایی برای تعیین کیفیت مدل کافی نیست. یک مدل بزرگ می‌تواند در یک وظیفه عملکرد بسیار خوبی داشته باشد و در وظیفه‌ای دیگر نسبت به مدل کوچک‌تر مزیت مشخصی نداشته باشد.

برای ارزیابی واقعی یک مدل باید معیارهایی مانند توانایی استدلال، دقت، کیفیت کدنویسی، درک متن، عملکرد چندوجهی، سرعت پاسخ، هزینه استفاده و میزان خطا نیز بررسی شود.

به همین دلیل، ادعاهای مربوط به عملکرد مدل‌ها باید بر اساس آزمون‌های استاندارد و قابل مقایسه بررسی شوند. علی‌بابا در معرفی Qwen3.۸-Max بر عملکرد آن در مجموعه‌ای از کاربردهای پیشرفته تأکید کرده است، اما ارزیابی مستقل و مقایسه مستقیم با مدل‌های رقیب نیازمند آزمون‌های جداگانه است.

تأثیر Qwen3.۸-Max بر بازار هوش مصنوعی

ورود مدل‌هایی با مقیاس تریلیون پارامتری نشان‌دهنده افزایش سرمایه‌گذاری شرکت‌های بزرگ روی زیرساخت‌های هوش مصنوعی است. ساخت و سرویس‌دهی چنین مدل‌هایی به مراکز داده، پردازنده‌های قدرتمند، شبکه‌های پرسرعت و زیرساخت نرم‌افزاری گسترده نیاز دارد.

در نتیجه، رقابت میان شرکت‌های هوش مصنوعی تنها به کیفیت پاسخ یک چت‌بات محدود نیست و موضوعاتی مانند هزینه محاسبات، دسترسی جهانی، توسعه‌دهندگان، ابزارهای جانبی و زیرساخت ابری نیز در آن نقش دارند.

Qwen3.۸-Max با قرار گرفتن در سبد مدل‌های پرچمدار علی‌بابا، بخشی از همین روند را نشان می‌دهد؛ روندی که در آن شرکت‌های فناوری تلاش می‌کنند مدل‌هایی با ظرفیت پردازش بالاتر و توانایی انجام وظایف پیچیده‌تر ارائه کنند.

کاربران ایرانی چه کاربردی می‌توانند از این مدل داشته باشند؟

برای کاربران ایرانی، مدل‌هایی مانند Qwen3.۸-Max می‌توانند در حوزه‌هایی مانند تولید محتوا، برنامه‌نویسی، ترجمه، تحلیل اسناد، تحقیق، ایده‌پردازی و پردازش اطلاعات مورد استفاده قرار گیرند؛ البته دسترسی به سرویس، شرایط حساب کاربری و هزینه API می‌تواند بسته به ارائه‌دهنده متفاوت باشد.

در حوزه تولید محتوا نیز مدل‌های هوش مصنوعی می‌توانند در تهیه پیش‌نویس، ساختاردهی مطالب، خلاصه‌سازی و بازنویسی کمک کنند. با این حال، برای محتوای خبری و تخصصی همچنان بررسی منابع و کنترل انسانی اهمیت زیادی دارد.

دیدگاه نیوز نیز در مطالب مختلف خود به گسترش کاربرد مدل‌های زبانی و ابزارهای هوش مصنوعی پرداخته است؛ از جمله در گزارش چالش کمبود داده برای زبان‌های مختلف در عصر هوش مصنوعی.

Qwen3.۸-Max چه تفاوتی با یک چت‌بات معمولی دارد؟

یک مدل زبانی در اصل موتور هوش مصنوعی است و یک چت‌بات یا سرویس آنلاین می‌تواند رابطی برای استفاده از آن باشد. بنابراین Qwen3.۸-Max را باید به عنوان یک مدل پایه در نظر گرفت که می‌تواند در سرویس‌ها و سامانه‌های مختلف مورد استفاده قرار گیرد.

شرکت‌ها می‌توانند مدل‌های بزرگ را از طریق API در نرم‌افزارهای خود به کار بگیرند و قابلیت‌هایی مانند تولید متن، تحلیل داده، پاسخ‌گویی، کدنویسی یا پردازش تصویر را در محصولات خود قرار دهند.

این تفاوت برای توسعه‌دهندگان اهمیت زیادی دارد، زیرا انتخاب یک مدل مناسب تنها به کیفیت مکالمه در یک صفحه چت محدود نمی‌شود و باید امکانات API، هزینه، سرعت، محدودیت‌ها، قابلیت‌های چندوجهی و شرایط استفاده نیز بررسی شود.

جمع‌بندی

Qwen3.۸-Max جدیدترین مدل پرچمدار معرفی‌شده از سوی علی‌بابا در خانواده Qwen است که با مقیاس ۲.۴ تریلیون پارامتر و پنجره زمینه تا یک میلیون توکن، برای پردازش وظایف پیچیده و طولانی طراحی شده است.

این مدل از معماری Sparse Mixture of Experts بهره می‌برد و طبق اعلام رسمی علی‌بابا، در زمینه‌هایی مانند کدنویسی، پژوهش، استدلال، انجام وظایف طولانی‌مدت و پردازش اطلاعات بصری کاربرد دارد. دسترسی به مدل از طریق APIهای Alibaba Cloud Model Studio و پلتفرم QwenWork اعلام شده است.

مقیاس ۲.۴ تریلیون پارامتر و زمینه یک میلیون توکنی از مهم‌ترین ویژگی‌های فنی این مدل هستند، اما ارزیابی کیفیت واقعی آن باید بر اساس آزمون‌های مستقل و مقایسه‌های همسان با سایر مدل‌های پیشرفته انجام شود.

عرضه Qwen3.۸-Max همچنین نشان می‌دهد که رقابت در صنعت هوش مصنوعی به سمت مدل‌هایی با زمینه طولانی‌تر، قابلیت‌های چندوجهی و توانایی انجام وظایف چندمرحله‌ای حرکت کرده است؛ مسیری که احتمالاً در نسل‌های بعدی مدل‌های هوش مصنوعی نیز ادامه خواهد داشت.

نظر شما در مورد این مطلب چیست؟ نظرات خود را در پایین همین صفحه با ما در میان بگذارید. 👇


دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *