فهم هيكل Transformer بلغة بسيطة

فهم بنية المحولات بلغة بسيطة
ثوريّت المحولات في مجال الذكاء الاصطناعي، لا سيما في معالجة اللغة الطبيعية (NLP). يهدف هذا المقال إلى توضيح كيفية عمل بنية المحولات، مما يجعلها قابلة للفهم للمهنيين والهواة على حد سواء.
ما هو المحول؟
في جوهره، المحول هو نوع من بنية الشبكة العصبية التي تعالج البيانات بشكل متوازي بدلاً من تسلسلي. هذه الخاصية تتيح له التعامل مع كميات كبيرة من المعلومات بكفاءة، مما يجعله قويًا بشكل خاص للمهام التي تتعلق بالنصوص والصور وأنواع البيانات الأخرى.
أصبح إدخال المحولات نقطة تحول كبيرة مقارنة بالبُنى السابقة مثل الشبكات العصبية التكرارية (RNNs) وشبكات الذاكرة القصيرة والطويلة الأمد (LSTMs)، والتي كانت تعالج البيانات بشكل تسلسلي. من خلال الاستفادة من آليات الانتباه، يمكن للمحولات قياس أهمية أجزاء مختلفة من بيانات الإدخال، مما يؤدي إلى تحسين الفهم وتوليد تسلسلات بيانات معقدة.
المكونات الرئيسية لبنية المحول
يتطلب فهم تفاصيل بنية المحولات استكشاف مكوناتها الأساسية:
1. تمثيل الإدخال
تبدأ المحولات بتمثيلات الإدخال التي تحول البيانات الخام إلى تنسيق مناسب للمعالجة. بالنسبة للنصوص، يشمل هذا غالبًا تجزئة النص، التي تُقسّم الجمل إلى قطع قابلة للإدارة تُعرف بالتوكنز (tokens). يتم تمثيل كل توكن بعد ذلك كمتجه، وهو تمثيل عددي يلتقط معناه ضمن سياق معين.
2. آلية الانتباه الذاتي
آلية الانتباه الذاتي هي عنصر أساسي في المحولات. تتيح للنموذج قياس أهمية كل توكن بالنسبة للآخرين في التسلسل. على سبيل المثال، في الجملة "القط جلس على السجادة"، يتعلم النموذج ربط "القط" بشكل أقوى مع "جلس" منه مع "السجادة". هذه القدرة على التركيز على التوكنات ذات الصلة تعزز الفهم السياقي للنموذج.
3. الانتباه متعدد الرؤوس
لتحسين قدرة النموذج على معالجة المعلومات، تستخدم المحولات الانتباه متعدد الرؤوس. تتضمن هذه التقنية تشغيل العديد من آليات الانتباه الذاتي بشكل متوازي، مما يمكّن النموذج من التقاط علاقات وخصائص مختلفة من بيانات الإدخال في الوقت نفسه. ثم يتم دمج نتائج هذه الرؤوس وتحويلها، مما يوفر تمثيلًا أغنى للإدخال.
4. شبكات عصبية تغذية أمامية
بعد الانتباه الذاتي، يتم تمرير الناتج عبر شبكات عصبية تغذية أمامية. هذه الشبكات تطبّق تحولات متعلمة على البيانات، مما يعزز المعلومات بشكل فعال قبل أن تنتقل إلى الطبقة التالية من النموذج. كل موضع في الإدخال له شبكة تغذية أمامية خاصة به، مما يعزز قدرة النموذج على تعلم الأنماط المعقدة.

