هوش مصنوعی مولد چیست و چگونه زندگی ما را تغییر میدهد؟
ساختار هوش مصنوعی مولد چگونه است؟ بررسی معماری Generative AI از توکن تا تولید محتوا هوش مصنوعی مولد یا Generative AI یکی از مهمترین شاخههای هوش مصنوعی مدرن است که توانایی تولید محتوای جدید مانند متن، تصویر، صدا، ویدئو و حتی کد را دارد. اما پشت یک پاسخ ساده از طرف ابزارهایی مانند چتباتهای هوش […]
ساختار هوش مصنوعی مولد چگونه است؟ بررسی معماری Generative AI از توکن تا تولید محتوا
هوش مصنوعی مولد یا Generative AI یکی از مهمترین شاخههای هوش مصنوعی مدرن است که توانایی تولید محتوای جدید مانند متن، تصویر، صدا، ویدئو و حتی کد را دارد. اما پشت یک پاسخ ساده از طرف ابزارهایی مانند چتباتهای هوش مصنوعی، مجموعهای از مدلها، دادهها و فرایندهای محاسباتی پیچیده قرار گرفته است.
برای درک بهتر هوش مصنوعی مولد، باید با ساختار داخلی آن آشنا شویم؛ ساختاری که در بسیاری از مدلهای زبانی مدرن بر پایه معماری Transformer شکل گرفته است.
هوش مصنوعی مولد چیست؟
هوش مصنوعی مولد به گروهی از مدلهای هوش مصنوعی گفته میشود که میتوانند بر اساس دادههایی که در فرایند آموزش یاد گرفتهاند، محتوای جدید تولید کنند.
برای مثال، یک مدل مولد میتواند:
- یک متن جدید بنویسد
- به یک سؤال پاسخ دهد
- تصویر تولید کند
- کد برنامهنویسی بنویسد
- متن را خلاصه یا ترجمه کند
- موسیقی یا محتوای صوتی تولید کند
مایکروسافت در Microsoft Learn نیز Generative AI را نوعی از هوش مصنوعی معرفی میکند که میتواند بر اساس ورودی کاربر، محتوای جدید تولید کند. این محتوا میتواند شامل متن، تصویر، موسیقی و موارد دیگر باشد. (Microsoft Learn)
ساختار هوش مصنوعی مولد از چه بخشهایی تشکیل شده است؟
اگر بخواهیم ساختار یک سیستم هوش مصنوعی مولد را به زبان ساده نمایش دهیم، میتوان آن را به چند بخش اصلی تقسیم کرد:
داده آموزشی → توکنسازی → Embedding → معماری مدل → پردازش و پیشبینی → تولید خروجی
هرکدام از این مراحل نقش مهمی در عملکرد مدل دارند.
۱. دادههای آموزشی؛ نقطه شروع مدل
مدلهای هوش مصنوعی مولد ابتدا به حجم بسیار زیادی از داده نیاز دارند.
برای یک مدل زبانی، این دادهها میتوانند شامل متنهای مختلف باشند. مدل در زمان آموزش، الگوهای موجود در این دادهها را یاد میگیرد؛ برای مثال، نحوه قرار گرفتن کلمات در کنار یکدیگر، ساختار جملهها و ارتباط مفاهیم مختلف.
در این مرحله مدل قرار نیست یک متن مشخص را مانند یک فایل ذخیره کند؛ بلکه پارامترهای شبکه عصبی در فرایند آموزش بهگونهای تنظیم میشوند که الگوهای موجود در دادهها را بهتر مدل کنند.
Microsoft Learn توضیح میدهد که LLMها با مجموعههای بسیار بزرگی از دادههای متنی آموزش داده میشوند و این فرایند به آنها امکان میدهد الگوهای زبان، معنا و ساختار متن را یاد بگیرند. (Microsoft Learn)
۲. Tokenization؛ تبدیل متن به توکن
مدل زبانی نمیتواند مستقیماً مانند انسان جمله را بخواند. ابتدا متن ورودی به واحدهایی به نام Token تبدیل میشود.
یک توکن میتواند یک کلمه کامل، بخشی از یک کلمه یا حتی علامت نگارشی باشد.
برای مثال، جمله:
هوش مصنوعی آینده فناوری است.
ابتدا به مجموعهای از توکنها تبدیل میشود و سپس هر توکن یک شناسه عددی دریافت میکند.
Microsoft Learn توضیح میدهد که متن در مدلهای زبانی ابتدا به توکنها تقسیم میشود و هر توکن با یک شناسه عددی نمایش داده میشود. (Microsoft Learn)
۳. Embedding؛ تبدیل توکن به نمایش عددی
بعد از Tokenization، مدل باید بتواند ارتباط معنایی توکنها را پردازش کند.
برای این کار، توکنها به بردارهای عددی تبدیل میشوند که به آنها Embedding گفته میشود.
به زبان ساده، Embedding روشی است که به مدل اجازه میدهد اطلاعات مربوط به معنا و ارتباط توکنها را در قالب اعداد پردازش کند.
برای مثال، کلمات و مفاهیمی که در زمینههای مشابه استفاده میشوند، میتوانند در فضای برداری ارتباط بیشتری با یکدیگر داشته باشند.
Microsoft Learn، Embedding را یک ساختار ریاضی از اعداد معرفی میکند که معنای توکن را در زمینهای که استفاده شده است نمایش میدهد. (Microsoft Learn)
۴. Transformer؛ هسته بسیاری از مدلهای مولد مدرن
یکی از مهمترین بخشهای ساختار مدلهای زبانی مدرن، معماری Transformer است.
معماری Transformer نقش بسیار مهمی در توسعه مدلهای زبانی بزرگ یا LLMها داشته است.
یکی از ویژگیهای مهم Transformer استفاده از مکانیزمی به نام Attention است.
Attention به مدل کمک میکند هنگام پردازش یک بخش از ورودی، ارتباط آن را با بخشهای دیگر بررسی کند.
به عنوان مثال، در یک جمله طولانی ممکن است معنای یک کلمه به کلمات دیگری که چندین کلمه قبلتر آمدهاند وابسته باشد. مکانیزم Attention به مدل کمک میکند این ارتباطها را بهتر در نظر بگیرد.
Microsoft Learn نیز Transformer را یکی از فناوریهای کلیدی در مسیر توسعه مدلهای زبانی بزرگ معرفی میکند. (Microsoft Learn)
۵. Attention چگونه به مدل کمک میکند؟
یکی از مفاهیم کلیدی در معماری Transformer، Self-Attention است.
در این روش، مدل هنگام پردازش یک توکن، میزان ارتباط آن را با توکنهای دیگر بررسی میکند.
در نتیجه، مدل فقط به یک کلمه به صورت مستقل نگاه نمیکند؛ بلکه تلاش میکند آن را در زمینه کل ورودی تفسیر کند.
این موضوع یکی از دلایل مهم قدرت مدلهای زبانی مدرن در پردازش متنهای پیچیده است.
در آموزشهای Microsoft Learn، Attention، Tokenization و Embedding به عنوان مفاهیم اصلی برای درک نحوه عملکرد مدلهای زبانی معرفی شدهاند. (Microsoft Learn)
۶. پارامترها؛ چیزی که مدل در فرایند آموزش یاد میگیرد
مدلهای بزرگ هوش مصنوعی دارای تعداد بسیار زیادی Parameter هستند.
پارامترها مقادیر عددیای هستند که در فرایند آموزش مدل تنظیم میشوند. این مقادیر در کنار معماری شبکه عصبی، بخش مهمی از قابلیت مدل برای شناسایی الگوها را تشکیل میدهند.
هرچه مدل پیچیدهتر و بزرگتر باشد، ممکن است تعداد پارامترهای آن نیز بسیار زیاد باشد؛ البته تعداد پارامترها به تنهایی معیار کاملی برای سنجش کیفیت یک مدل نیست.
۷. آموزش مدل چگونه انجام میشود؟
یکی از روشهای مهم آموزش مدلهای زبانی، یادگیری برای پیشبینی توکن بعدی است.
فرض کنیم مدل با جملهای مانند:
«امروز هوا خیلی …»
مواجه شود.
مدل تلاش میکند بر اساس اطلاعات قبلی، محتملترین ادامه را پیشبینی کند.
در فرایند آموزش، پیشبینی مدل با مقدار واقعی مقایسه میشود و میزان خطا محاسبه میشود. سپس پارامترهای مدل بهتدریج تغییر میکنند تا مدل در پیشبینیهای بعدی عملکرد بهتری داشته باشد.
Microsoft Learn توضیح میدهد که مدلهای زبانی در فرایند آموزش، توکن بعدی را بر اساس توکنهای قبلی پیشبینی میکنند و با مقایسه پیشبینی و مقدار واقعی، پارامترهای خود را بهروزرسانی میکنند. (Microsoft Learn)
۸. هنگام پاسخ دادن چه اتفاقی میافتد؟
وقتی کاربر یک سؤال را وارد یک مدل زبانی میکند، فرایند تقریباً به شکل زیر پیش میرود:
Prompt → Tokenization → Embedding → پردازش توسط مدل → پیشبینی توکن بعدی → تولید توکن بعدی → تکرار فرایند
مدل ابتدا ورودی را دریافت و به توکن تبدیل میکند. سپس این توکنها در مدل پردازش میشوند.
مدل در ادامه توکن بعدی را پیشبینی میکند. این فرایند بارها تکرار میشود تا پاسخ نهایی ساخته شود.
به همین دلیل پاسخ یک مدل زبانی را میتوان حاصل تولید تدریجی مجموعهای از توکنها دانست.
۹. نقش Prompt در هوش مصنوعی مولد
کاربر برای تعامل با یک مدل مولد، معمولاً یک Prompt به مدل میدهد.
Prompt میتواند یک سؤال ساده یا یک دستور بسیار دقیق باشد.
برای مثال:
«یک مقاله درباره امنیت سایبری بنویس.»
یا:
«یک مقاله ۱۵۰۰ کلمهای درباره امنیت سایبری برای کاربران مبتدی بنویس و پنج مثال کاربردی ارائه بده.»
هرچه دستور دقیقتر باشد، مدل اطلاعات بیشتری درباره هدف کاربر دریافت میکند.
به همین دلیل Prompt Engineering به یکی از مهارتهای مهم در کار با سیستمهای هوش مصنوعی مولد تبدیل شده است.
۱۰. Fine-tuning؛ تخصصیتر کردن مدل
یک مدل پایه معمولاً برای طیف گستردهای از وظایف آموزش داده میشود. اما در برخی پروژهها لازم است مدل برای یک حوزه یا وظیفه خاص بهتر شود.
در این شرایط میتوان از Fine-tuning استفاده کرد.
در Fine-tuning، یک مدل از پیش آموزشدیده با مجموعه دادهای تخصصیتر آموزش داده میشود تا برای یک وظیفه یا حوزه مشخص سازگارتر شود.
Microsoft Learn نیز Fine-tuning را به عنوان روشی برای سازگار کردن مدلهای زبانی از پیش آموزشدیده با وظایف و حوزههای تخصصی معرفی میکند. (Microsoft Learn)
تفاوت ساختار مدلهای متنی و تصویری
هوش مصنوعی مولد فقط به مدلهای تولید متن محدود نمیشود.
مدلهای مختلف میتوانند برای تولید انواع محتوا طراحی شوند.
برای نمونه، مدلهای تولید متن معمولاً از معماریهایی مانند Transformer استفاده میکنند، در حالی که در حوزه تولید تصویر، معماریهایی مانند GAN و VAE نیز در توسعه مدلهای مولد مورد استفاده قرار گرفتهاند. (Microsoft Learn)
در نسل جدید سیستمهای مولد، مدلهای چندوجهی نیز میتوانند با انواع مختلف داده مانند متن، تصویر و صدا کار کنند.
جمعبندی
هوش مصنوعی مولد یک فناوری واحد و ساده نیست؛ بلکه مجموعهای از مدلها، الگوریتمها و فرایندهای مختلف است که در کنار یکدیگر امکان تولید محتوای جدید را فراهم میکنند.
در مدلهای زبانی مدرن، میتوان مسیر کلی را اینگونه خلاصه کرد:
دادههای آموزشی → Tokenization → Embedding → Transformer و Attention → آموزش مدل → دریافت Prompt → پیشبینی توکنها → تولید پاسخ
درک این ساختار کمک میکند بدانیم ابزارهایی که امروزه بهسادگی با آنها صحبت میکنیم، در پشت صحنه چه فرایند پیچیدهای را انجام میدهند.
با توسعه مدلهای بزرگ زبانی و مدلهای چندوجهی، هوش مصنوعی مولد نیز در حال تبدیل شدن به یکی از فناوریهای مهم در حوزه تولید محتوا، برنامهنویسی، تحلیل داده، آموزش و بسیاری از کسبوکارهاست.
شاید اینها هم به کارتان بیاید
اخبار
معرفی فریمورک NOOA توسط انویدیا: تبدیل هوش مصنوعی به یک کلاس پایتون!
انویدیا چارچوب متنباز NOOA را معرفی کرده است؛ روشی شیءگرا برای ساخت عاملهای هوش مصنوعی که بخش بزرگی از منطق عامل را…
تکنولوژی
جان ترنوس؛ مدیرعامل جدید اپل کیست؟ بررسی زندگی، سوابق، مسیر شغلی و چالشهای آینده اپل
جان ترنوس (John Ternus) از اول سپتامبر ۲۰۲۶ رسماً به عنوان مدیرعامل جدید شرکت اپل فعالیت خود را آغاز کرد و پس…
تکنولوژی
آموزش Perplexity؛ چطور از این ابزار هوش مصنوعی برای جستوجو و تحقیق استفاده کنیم؟
Perplexity یک ابزار جستوجوی مبتنی بر هوش مصنوعی است که به جای اینکه فقط چند لینک جلوی شما بگذارد، موضوعی را که…