Raheb log | راهب لاگ "راهب لاگ | raheb log" یک جامعه ی فعال ارائه دهنده مقالات در زمینه تکنولوژی
تکنولوژی

هوش مصنوعی مولد چیست و چگونه زندگی ما را تغییر می‌دهد؟

Sara 8 دقیقه مطالعه

ساختار هوش مصنوعی مولد چگونه است؟ بررسی معماری Generative AI از توکن تا تولید محتوا هوش مصنوعی مولد یا Generative AI یکی از مهم‌ترین شاخه‌های هوش مصنوعی مدرن است که توانایی تولید محتوای جدید مانند متن، تصویر، صدا، ویدئو و حتی کد را دارد. اما پشت یک پاسخ ساده از طرف ابزارهایی مانند چت‌بات‌های هوش […]

ساختار هوش مصنوعی مولد چگونه است؟ بررسی معماری Generative AI از توکن تا تولید محتوا

هوش مصنوعی مولد یا Generative AI یکی از مهم‌ترین شاخه‌های هوش مصنوعی مدرن است که توانایی تولید محتوای جدید مانند متن، تصویر، صدا، ویدئو و حتی کد را دارد. اما پشت یک پاسخ ساده از طرف ابزارهایی مانند چت‌بات‌های هوش مصنوعی، مجموعه‌ای از مدل‌ها، داده‌ها و فرایندهای محاسباتی پیچیده قرار گرفته است.

برای درک بهتر هوش مصنوعی مولد، باید با ساختار داخلی آن آشنا شویم؛ ساختاری که در بسیاری از مدل‌های زبانی مدرن بر پایه معماری Transformer شکل گرفته است.

هوش مصنوعی مولد چیست؟

هوش مصنوعی مولد به گروهی از مدل‌های هوش مصنوعی گفته می‌شود که می‌توانند بر اساس داده‌هایی که در فرایند آموزش یاد گرفته‌اند، محتوای جدید تولید کنند.

برای مثال، یک مدل مولد می‌تواند:

  • یک متن جدید بنویسد
  • به یک سؤال پاسخ دهد
  • تصویر تولید کند
  • کد برنامه‌نویسی بنویسد
  • متن را خلاصه یا ترجمه کند
  • موسیقی یا محتوای صوتی تولید کند

مایکروسافت در Microsoft Learn نیز Generative AI را نوعی از هوش مصنوعی معرفی می‌کند که می‌تواند بر اساس ورودی کاربر، محتوای جدید تولید کند. این محتوا می‌تواند شامل متن، تصویر، موسیقی و موارد دیگر باشد. (Microsoft Learn)

ساختار هوش مصنوعی مولد از چه بخش‌هایی تشکیل شده است؟

اگر بخواهیم ساختار یک سیستم هوش مصنوعی مولد را به زبان ساده نمایش دهیم، می‌توان آن را به چند بخش اصلی تقسیم کرد:

داده آموزشی → توکن‌سازی → Embedding → معماری مدل → پردازش و پیش‌بینی → تولید خروجی

هرکدام از این مراحل نقش مهمی در عملکرد مدل دارند.

۱. داده‌های آموزشی؛ نقطه شروع مدل

مدل‌های هوش مصنوعی مولد ابتدا به حجم بسیار زیادی از داده نیاز دارند.

برای یک مدل زبانی، این داده‌ها می‌توانند شامل متن‌های مختلف باشند. مدل در زمان آموزش، الگوهای موجود در این داده‌ها را یاد می‌گیرد؛ برای مثال، نحوه قرار گرفتن کلمات در کنار یکدیگر، ساختار جمله‌ها و ارتباط مفاهیم مختلف.

در این مرحله مدل قرار نیست یک متن مشخص را مانند یک فایل ذخیره کند؛ بلکه پارامترهای شبکه عصبی در فرایند آموزش به‌گونه‌ای تنظیم می‌شوند که الگوهای موجود در داده‌ها را بهتر مدل کنند.

Microsoft Learn توضیح می‌دهد که LLMها با مجموعه‌های بسیار بزرگی از داده‌های متنی آموزش داده می‌شوند و این فرایند به آن‌ها امکان می‌دهد الگوهای زبان، معنا و ساختار متن را یاد بگیرند. (Microsoft Learn)

۲. Tokenization؛ تبدیل متن به توکن

مدل زبانی نمی‌تواند مستقیماً مانند انسان جمله را بخواند. ابتدا متن ورودی به واحدهایی به نام Token تبدیل می‌شود.

یک توکن می‌تواند یک کلمه کامل، بخشی از یک کلمه یا حتی علامت نگارشی باشد.

برای مثال، جمله:

هوش مصنوعی آینده فناوری است.

ابتدا به مجموعه‌ای از توکن‌ها تبدیل می‌شود و سپس هر توکن یک شناسه عددی دریافت می‌کند.

Microsoft Learn توضیح می‌دهد که متن در مدل‌های زبانی ابتدا به توکن‌ها تقسیم می‌شود و هر توکن با یک شناسه عددی نمایش داده می‌شود. (Microsoft Learn)

۳. Embedding؛ تبدیل توکن به نمایش عددی

بعد از Tokenization، مدل باید بتواند ارتباط معنایی توکن‌ها را پردازش کند.

برای این کار، توکن‌ها به بردارهای عددی تبدیل می‌شوند که به آن‌ها Embedding گفته می‌شود.

به زبان ساده، Embedding روشی است که به مدل اجازه می‌دهد اطلاعات مربوط به معنا و ارتباط توکن‌ها را در قالب اعداد پردازش کند.

برای مثال، کلمات و مفاهیمی که در زمینه‌های مشابه استفاده می‌شوند، می‌توانند در فضای برداری ارتباط بیشتری با یکدیگر داشته باشند.

Microsoft Learn، Embedding را یک ساختار ریاضی از اعداد معرفی می‌کند که معنای توکن را در زمینه‌ای که استفاده شده است نمایش می‌دهد. (Microsoft Learn)

۴. Transformer؛ هسته بسیاری از مدل‌های مولد مدرن

یکی از مهم‌ترین بخش‌های ساختار مدل‌های زبانی مدرن، معماری Transformer است.

معماری Transformer نقش بسیار مهمی در توسعه مدل‌های زبانی بزرگ یا LLMها داشته است.

یکی از ویژگی‌های مهم Transformer استفاده از مکانیزمی به نام Attention است.

Attention به مدل کمک می‌کند هنگام پردازش یک بخش از ورودی، ارتباط آن را با بخش‌های دیگر بررسی کند.

به عنوان مثال، در یک جمله طولانی ممکن است معنای یک کلمه به کلمات دیگری که چندین کلمه قبل‌تر آمده‌اند وابسته باشد. مکانیزم Attention به مدل کمک می‌کند این ارتباط‌ها را بهتر در نظر بگیرد.

Microsoft Learn نیز Transformer را یکی از فناوری‌های کلیدی در مسیر توسعه مدل‌های زبانی بزرگ معرفی می‌کند. (Microsoft Learn)

۵. Attention چگونه به مدل کمک می‌کند؟

یکی از مفاهیم کلیدی در معماری Transformer، Self-Attention است.

در این روش، مدل هنگام پردازش یک توکن، میزان ارتباط آن را با توکن‌های دیگر بررسی می‌کند.

در نتیجه، مدل فقط به یک کلمه به صورت مستقل نگاه نمی‌کند؛ بلکه تلاش می‌کند آن را در زمینه کل ورودی تفسیر کند.

این موضوع یکی از دلایل مهم قدرت مدل‌های زبانی مدرن در پردازش متن‌های پیچیده است.

در آموزش‌های Microsoft Learn، Attention، Tokenization و Embedding به عنوان مفاهیم اصلی برای درک نحوه عملکرد مدل‌های زبانی معرفی شده‌اند. (Microsoft Learn)

۶. پارامترها؛ چیزی که مدل در فرایند آموزش یاد می‌گیرد

مدل‌های بزرگ هوش مصنوعی دارای تعداد بسیار زیادی Parameter هستند.

پارامترها مقادیر عددی‌ای هستند که در فرایند آموزش مدل تنظیم می‌شوند. این مقادیر در کنار معماری شبکه عصبی، بخش مهمی از قابلیت مدل برای شناسایی الگوها را تشکیل می‌دهند.

هرچه مدل پیچیده‌تر و بزرگ‌تر باشد، ممکن است تعداد پارامترهای آن نیز بسیار زیاد باشد؛ البته تعداد پارامترها به تنهایی معیار کاملی برای سنجش کیفیت یک مدل نیست.

۷. آموزش مدل چگونه انجام می‌شود؟

یکی از روش‌های مهم آموزش مدل‌های زبانی، یادگیری برای پیش‌بینی توکن بعدی است.

فرض کنیم مدل با جمله‌ای مانند:

«امروز هوا خیلی …»

مواجه شود.

مدل تلاش می‌کند بر اساس اطلاعات قبلی، محتمل‌ترین ادامه را پیش‌بینی کند.

در فرایند آموزش، پیش‌بینی مدل با مقدار واقعی مقایسه می‌شود و میزان خطا محاسبه می‌شود. سپس پارامترهای مدل به‌تدریج تغییر می‌کنند تا مدل در پیش‌بینی‌های بعدی عملکرد بهتری داشته باشد.

Microsoft Learn توضیح می‌دهد که مدل‌های زبانی در فرایند آموزش، توکن بعدی را بر اساس توکن‌های قبلی پیش‌بینی می‌کنند و با مقایسه پیش‌بینی و مقدار واقعی، پارامترهای خود را به‌روزرسانی می‌کنند. (Microsoft Learn)

۸. هنگام پاسخ دادن چه اتفاقی می‌افتد؟

وقتی کاربر یک سؤال را وارد یک مدل زبانی می‌کند، فرایند تقریباً به شکل زیر پیش می‌رود:

Prompt → Tokenization → Embedding → پردازش توسط مدل → پیش‌بینی توکن بعدی → تولید توکن بعدی → تکرار فرایند

مدل ابتدا ورودی را دریافت و به توکن تبدیل می‌کند. سپس این توکن‌ها در مدل پردازش می‌شوند.

مدل در ادامه توکن بعدی را پیش‌بینی می‌کند. این فرایند بارها تکرار می‌شود تا پاسخ نهایی ساخته شود.

به همین دلیل پاسخ یک مدل زبانی را می‌توان حاصل تولید تدریجی مجموعه‌ای از توکن‌ها دانست.

۹. نقش Prompt در هوش مصنوعی مولد

کاربر برای تعامل با یک مدل مولد، معمولاً یک Prompt به مدل می‌دهد.

Prompt می‌تواند یک سؤال ساده یا یک دستور بسیار دقیق باشد.

برای مثال:

«یک مقاله درباره امنیت سایبری بنویس.»

یا:

«یک مقاله ۱۵۰۰ کلمه‌ای درباره امنیت سایبری برای کاربران مبتدی بنویس و پنج مثال کاربردی ارائه بده.»

هرچه دستور دقیق‌تر باشد، مدل اطلاعات بیشتری درباره هدف کاربر دریافت می‌کند.

به همین دلیل Prompt Engineering به یکی از مهارت‌های مهم در کار با سیستم‌های هوش مصنوعی مولد تبدیل شده است.

۱۰. Fine-tuning؛ تخصصی‌تر کردن مدل

یک مدل پایه معمولاً برای طیف گسترده‌ای از وظایف آموزش داده می‌شود. اما در برخی پروژه‌ها لازم است مدل برای یک حوزه یا وظیفه خاص بهتر شود.

در این شرایط می‌توان از Fine-tuning استفاده کرد.

در Fine-tuning، یک مدل از پیش آموزش‌دیده با مجموعه داده‌ای تخصصی‌تر آموزش داده می‌شود تا برای یک وظیفه یا حوزه مشخص سازگارتر شود.

Microsoft Learn نیز Fine-tuning را به عنوان روشی برای سازگار کردن مدل‌های زبانی از پیش آموزش‌دیده با وظایف و حوزه‌های تخصصی معرفی می‌کند. (Microsoft Learn)

تفاوت ساختار مدل‌های متنی و تصویری

هوش مصنوعی مولد فقط به مدل‌های تولید متن محدود نمی‌شود.

مدل‌های مختلف می‌توانند برای تولید انواع محتوا طراحی شوند.

برای نمونه، مدل‌های تولید متن معمولاً از معماری‌هایی مانند Transformer استفاده می‌کنند، در حالی که در حوزه تولید تصویر، معماری‌هایی مانند GAN و VAE نیز در توسعه مدل‌های مولد مورد استفاده قرار گرفته‌اند. (Microsoft Learn)

در نسل جدید سیستم‌های مولد، مدل‌های چندوجهی نیز می‌توانند با انواع مختلف داده مانند متن، تصویر و صدا کار کنند.

جمع‌بندی

هوش مصنوعی مولد یک فناوری واحد و ساده نیست؛ بلکه مجموعه‌ای از مدل‌ها، الگوریتم‌ها و فرایندهای مختلف است که در کنار یکدیگر امکان تولید محتوای جدید را فراهم می‌کنند.

در مدل‌های زبانی مدرن، می‌توان مسیر کلی را این‌گونه خلاصه کرد:

داده‌های آموزشی → Tokenization → Embedding → Transformer و Attention → آموزش مدل → دریافت Prompt → پیش‌بینی توکن‌ها → تولید پاسخ

درک این ساختار کمک می‌کند بدانیم ابزارهایی که امروزه به‌سادگی با آن‌ها صحبت می‌کنیم، در پشت صحنه چه فرایند پیچیده‌ای را انجام می‌دهند.

با توسعه مدل‌های بزرگ زبانی و مدل‌های چندوجهی، هوش مصنوعی مولد نیز در حال تبدیل شدن به یکی از فناوری‌های مهم در حوزه تولید محتوا، برنامه‌نویسی، تحلیل داده، آموزش و بسیاری از کسب‌وکارهاست.

// مقالات پیشنهادی

شاید این‌ها هم به کارتان بیاید

Sara
نویسنده مقاله Sara

«For the win»

There is interest in software

دیدن همه مقالات این نویسنده ←

دیدگاه بگذارید