AWS Certified AI Practitioner

اختيار النموذج الأساسي

يسمّي الاختبار ثمانية عوامل لاختيار نموذج أساسي مدرَّب مسبقاً. هذا الدرس يمشي على كل عامل، وما يعنيه لتصميمك، والإشارة التي يستخدمها الاختبار للدلالة عليه.

متوسط 18 دقائق 4 أهداف التعلّم
  1. سرد العوامل الثمانية التي يسميها الاختبار لاختيار نموذج أساسي مدرَّب مسبقاً
  2. شرح النتيجة التصميمية لكل عامل، خصوصاً نوع الوسائط وطول المدخل والمخرج ودعم التخصيص
  3. التمييز بين حجم النموذج وتعقيده، وشرح لماذا لا يكون الأكبر خياراً افتراضياً آمناً
  4. مطابقة سيناريو بالعامل الواحد الذي يحسمه

الدرس السابق في المجال الثاني علّمك منهج اختيار النموذج: استبعد على القيود الصارمة، ثم قيّم الناجين على مهمتك، ثم حسّن التكلفة وزمن الاستجابة لمن عبر. ذلك المنهج هو ترتيب العمليات. وهذا الدرس هو القائمة التي يعمل عليها المنهج.

يسمّي دليل الاختبار، في هدف المهمة 3.1، مجموعة محددة من العوامل لاختيار نموذج أساسي مدرَّب مسبقاً: "التكلفة، ونوع الوسائط، وزمن الاستجابة، ودعم اللغات، وحجم النموذج، وتعقيد النموذج، والتخصيص، وطول المدخل والمخرج". كل عامل نوع مختلف من الأسئلة، ولكل واحد نتيجة تصميمية تشعر بها لاحقاً إن تخطيته. وسؤال هذا الموضوع يخفي عادة أحد هذه العوامل في صياغة السيناريو، ويجعل الخيار المغري هو النموذج الذي كان سيفوز لو حُذفت تلك الجملة. فالمهارة المفيدة هي التعرف على العامل الذي يختبره السيناريو فعلاً.

سنمشي عليها بالترتيب الذي تعضّ به عادة، لا بالترتيب الذي يعدّدها به الدليل.

نوع الوسائط: ما يدخل وما يخرج

نوع الوسائط هو نوع البيانات التي يقبلها النموذج وينتجها. النموذج النصي يقرأ ويكتب نصاً. والنموذج متعدد الوسائط يقبل صوراً أو صوتاً أو فيديو مع النص. ونموذج embedding يعيد متجهات بدل النثر. ونموذج توليد الصور ينتج صوراً من وصف.

هذه ليست قابلة للتبادل، ولا عامل آخر ينقذ عدم تطابق في نوع الوسائط. النموذج النصي فقط لا يقرأ فاتورة ممسوحة، ولا يفرّغ مكالمة، ولا يصف صورة، والضبط الدقيق لا يضيف نوع مدخل. لهذا نوع الوسائط أول ما يُفحص: يستبعد المرشحين نهائياً قبل أن تُطرح الجودة على الطاولة أصلاً.

وهو أيضاً العامل الذي يموّهه الاختبار أكثر من غيره. يذكر سيناريو مستندات ممسوحة ضوئياً أو صور منتجات أو تسجيلات صوتية، ثم يعرض نموذجاً نصياً فقط بوصفه الخيار الأعلى في درجات المعايير. الدرجات إلهاء. اقرأ السيناريو باحثاً عن نوع المدخل الفعلي قبل أن تقرأ قدرات النموذج.

طول المدخل والمخرج: حدّان لا حد واحد

ينشر كل نموذج حدّي طول، والخلط بينهما طريقة موثوقة لإطلاق ميزة معطوبة.

نافذة السياق هي الحد الأقصى لعدد الـ tokens التي يستطيع النموذج أخذها في الطلب الواحد. كل شيء يُحسب عليها: تعليماتك، وأي مستندات مسترجَعة، والمحادثة حتى الآن، وسؤال المستخدم. أما الحد الأقصى لطول المخرج فحد منفصل على عدد الـ tokens التي يولّدها النموذج في الاستجابة الواحدة، وهو أصغر بكثير عادة من نافذة السياق.

الفجوة بينهما أوسع مما يتوقع معظم الناس. قد ينشر نموذج نافذة سياق 200,000 token مع حد أقصى للمخرج بضعة آلاف tokens فقط. هذا المزيج يقرأ مستنداً طويلاً براحة لكنه لا يكتب واحداً طويلاً. الفريق الذي يقرأ "200,000 token" ويخطط لتوليد تقرير كامل في استدعاء واحد يحصل على استجابة تتوقف في المنتصف، ولا شيء في الخطأ يفسّر السبب.

فينقسم سؤال التصميم قسمين. كم يحتاج الطلب الواحد أن يأخذ داخلاً، وهذا يحدد أرضية نافذة السياق، وكم يحتاج الجواب أن يطول، وهذا يحدد أرضية طول المخرج. ميزة التلخيص ثقيلة المدخل خفيفة المخرج. وميزة الصياغة الطويلة عكسها. طابِق النموذج مع الاتجاه الذي يميل إليه عبء عملك.

دعم اللغات

النموذج المدرَّب في معظمه على الإنجليزية سينتج الإسبانية أو العربية حين يُطلب منه، لكن بقواعد أضعف ومفردات أنحف وأخطاء أكثر مما يرتكبه بالإنجليزية. القدرة العامة لا تنتقل بالتساوي عبر اللغات، ولهذا يعدّ الدليل دعم اللغات عاملاً مستقلاً بدل طيّه في الدقة.

والنتيجة عملية. إن كان مستخدموك يكتبون بالبرتغالية ويقرؤون الإجابات بالبرتغالية، فالنموذج الذي يتصدر معايير الإنجليزية ويتعثر في البرتغالية خيار خاطئ، ولا ترى المشكلة إلا باختباره باللغة التي يستعملها مستخدموك فعلاً. حين يسمّي سيناريو جمهوراً غير ناطق بالإنجليزية أو اشتراط تعدد لغات، ينتقل هذا العامل إلى المقدمة.

حجم النموذج وتعقيده

يعدّد الدليل حجم النموذج وتعقيده عاملين، وهما يشيران إلى المقايضة نفسها من زاويتين. الحجم يعني عدد المعاملات. والتعقيد يعني كم من القدرة يشتريه ذلك وكم يكلّف تشغيله.

الحدس الذي يحمله الجميع تقريباً أن النموذج الأكبر خيار أأمن. ليس كذلك، والاختبار يكافئ معرفة السبب. النموذج الأكبر يكلّف أكثر لكل token، ويولّد أبطأ لأنه يعمل أكثر لكل token، ولا يُظهر غالباً تحسّناً قابلاً للقياس في مهمة ضيقة محددة جيداً. مصنّف يفرز تذاكر الدعم إلى ثماني فئات لا يحتاج استدلالاً في الطليعة. ودفع ثمن قدرة لا تمارسها المهمة أبداً هدر يتكرر على كل طلب، إلى الأبد.

النمط الذي يصمد عملياً هو البدء بنموذج أصغر والصعود فقط حين يُظهر تقييمك فجوة حقيقية. الفرق التي تبدأ من القمة نادراً ما تعود نزولاً، لأن لا أحد يتطوع لجعل المساعد أسوأ قليلاً توفيراً للمال، فيصير الدفع الزائد دائماً. حين يعطيك سيناريو موازنة زمن استجابة ضيقة أو مهمة بسيطة محدودة ويعرض نموذجاً كبيراً خياراً، يكون النموذج الأصغر الذي يجتاز مع ذلك هو الجواب المقصود عادة.

دعم التخصيص

إن كانت خطتك تعتمد على تكييف النموذج، سواء بالضبط الدقيق على أمثلتك أو بتأريضه في بياناتك، فعليك التأكد من دعم النموذج لذلك المسار قبل الالتزام به. ليست كل النماذج قابلة للضبط الدقيق، والقابلة منها تختلف في الطرق التي تقبلها وصيغة البيانات التي تتوقعها.

هذا عامل اختيار تحديداً لأن اكتشاف الحد متأخراً باهظ. الفريق الذي يختار نموذجاً على الجودة وحدها، ويبني حوله، ثم يعلم أنه لا يقبل الضبط الدقيق بالطريقة التي تحتاجها حالته، عليه أن يبدأ الاختيار من جديد. وموازنات التخصيص نفسها درس لاحق في هذا الموضوع. أما هنا فالنقطة أضيق: إن كان التخصيص جزءاً من الخطة، فهو جزء من الاختيار.

زمن الاستجابة والتكلفة

هذان العاملان اللذان تحسّنهما بعد أن يعبر النموذج كل ما سبق، وقد غطّت الدروس السابقة كليهما بعمق، فنُبقيهما قصيرين.

زمن الاستجابة هو سرعة رد النموذج. النماذج الأكبر أبطأ، والتوليد تسلسلي، فقد تستغرق إجابة طويلة من نموذج كبير عدة ثوانٍ. للتجربة الحية موازنة زمن استجابة، وأما مهمة دفعية ليلية فلا. تحقق من وفاء النموذج بالموازنة قبل بناء ميزة آنية عليه، بدل أن تأمل سدّ الفجوة لاحقاً.

التكلفة يحرّكها اختيار النموذج أكثر من أي تحسين للمطالبات. العبء نفسه قد يختلف بمراتب قدرية بين نموذجين في العائلة نفسها. ومن بين النماذج التي تعبر كل بوابة أخرى، الأرخص السريع الذي يجتاز حد الجودة هو الاختيار الصحيح.

العوامل في لمحة

العاملالسؤال الذي يطرحهكيف يتصرف
نوع الوسائطهل يقبل ويُنتج أنواع البيانات الصحيحة؟يستبعد
طول المدخل والمخرجهل يأخذ الطلب ويولّد جواباً طويلاً بما يكفي؟يستبعد أو يرتّب
دعم اللغاتهل يعمل جيداً باللغات التي يستعملها مستخدموي؟يستبعد أو يرتّب
حجم النموذج وتعقيدههل قدرته مطابقة للمهمة لا فائضة عنها؟يحسّن
التخصيصهل يدعم التكييف الذي تحتاجه خطتي؟يستبعد
زمن الاستجابةهل هو سريع بما يكفي للتجربة؟يحسّن
التكلفةهل هو الأرخص بين المؤهلين؟يحسّن

نصائح للاختبار

  • احفظ القائمة المسماة: التكلفة، ونوع الوسائط، وزمن الاستجابة، ودعم اللغات، وحجم النموذج، وتعقيده، والتخصيص، وطول المدخل والمخرج. ثم في أي سيناريو، جِد العامل الذي يحسم.
  • نوع الوسائط هو المرشّح الخفي الأكثر شيوعاً. وجود مدخل غير نصي في السيناريو مع نموذج نصي فقط في الخيارات يعني أن ذلك الخيار خاطئ مهما بلغت درجاته.
  • طول المدخل وطول المخرج حدّان منفصلان. نافذة سياق كبيرة لا تعِد باستجابة طويلة. انتبه لسيناريو يحتاج توليداً طويلاً ونموذج بسقف مخرج صغير.
  • دعم اللغات يطفو حين يُسمّى الجمهور غير ناطق بالإنجليزية. درجات المعايير العامة لا تحسمه.
  • تعقيد النموذج مقايضة لا هدف. موازنة زمن الاستجابة الضيقة أو المهمة الضيقة تشير إلى النموذج الأصغر الذي يجتاز مع ذلك.
  • دعم التخصيص يُفحص قبل الاختيار لا بعده. إن قالت الخطة اضبط دقيقاً، فتأكد أن النموذج قابل للضبط.

القاعدة التي تحملها إلى السؤال: اقرأ بحثاً عن القيد أولاً، ثم طابِقه بأحد العوامل الثمانية. معظم سيناريوهات اختيار النموذج يحسمها جملة واحدة. الدرس التالي ينتقل من اختيار النموذج إلى التحكم في كيفية استجابته، عبر معاملات الاستدلال التي تضبطها على كل طلب.