
النموذج الممتاز يفشل دون بنية تحتية تشغّله بموثوقية وأمان وتكلفة معقولة. إليك أساسيات MLOps والبنية على AWS، وكيف تبنيها MedGAN.
لماذا تحدّد البنية التحتية النتيجة
أكثر ما يقتل الذكاء الاصطناعي شيوعاً ليس نموذجاً رديئاً، بل نموذجاً جيداً لا يجد مكاناً موثوقاً يعمل فيه. فالنموذج الأولي الذي ينجح في دفتر ملاحظات، على بيانات منتقاة، في بيئة محكومة، ليس برمجيات إنتاج، والفجوة بين الاثنين هي حيث يتعثّر معظم الذكاء الاصطناعي للمؤسسات. تظلّ النماذج الممتازة تفشل دون بنية تشغّلها بموثوقية وأمان وتكلفة معقولة على نطاق واسع.
لهذه البنية اسم: البنية التحتية للذكاء الاصطناعي في الإنتاج، التي تُدار عبر MLOps. يشرح هذا الدليل ما يعنيه ذلك على AWS، وكيف تصمّمه MedGAN AI وتشغّله ليصمد ذكاؤك الاصطناعي فعلاً في العالم الحقيقي.
أحمال عمل الذكاء الاصطناعي ليست أحمال ويب عادية
قبل الحديث عن المكوّنات، ثمة أمر ينبغي استيعابه: الذكاء الاصطناعي يغيّر البنية المعمارية. فحوسبة GPU، ونقل البيانات على نطاق واسع، وإدارة إصدارات النماذج، والحوكمة الصارمة، جميعها تتصرّف على نحو مختلف عن تطبيق ويب اعتيادي. والسحابة المضبوطة بحجم مناسب لموقع إلكتروني تكون عادةً غير مناسبة للذكاء الاصطناعي، فإما تُحرَم من الحوسبة التي يحتاجها، أو تنزف مالاً على موارد لا يحتاجها.
لهذا يجب تصميم البنية التحتية للذكاء الاصطناعي من أجل الذكاء الاصطناعي منذ البداية، لا تكييفها بأثر رجعي بعد أول عطل أو أول فاتورة مفاجئة.
اللبنات الأساسية للذكاء الاصطناعي الإنتاجي على AWS
تتلخّص منصة الذكاء الاصطناعي الإنتاجية على AWS في ستّ ركائز أساسية.
| اللبنة الأساسية | ما تفعله | ما تمنعه |
|---|---|---|
| بنية سحابية للذكاء الاصطناعي | حوسبة GPU والبيانات والشبكات والأمان مصمّمة معاً | أداء مُجهَد أو إنفاق منفلت |
| Infrastructure-as-Code | بيئات قابلة للاستنساخ ومُدارة بالإصدارات | البيئة التي لا يستطيع أحد استنساخها |
| مسارات MLOps | إدارة الإصدارات والتراجع وإعادة التدريب الآلية | النموذج الذي يتدهور بصمت |
| الأمان والامتثال | ضوابط وصول وتشفير وحوكمة مدمَجة | التدارك بعد الحوادث وثغرات التدقيق |
| تحسين التكلفة والتوسّع التلقائي | التحجيم الأمثل والتوسّع الذكي | الفاتورة التي تفاجئ المدير المالي |
| المراقبة والاستجابة للحوادث | تنبيه متواصل واستجابة سريعة | الأعطال التي يكتشفها مستخدموك أولاً |
1. بنية سحابية مبنية للذكاء الاصطناعي
حوسبة GPU وخطوط أنابيب البيانات والشبكات والأمان مصمّمة معاً، بحيث يحصل النموذج على الأداء الذي يحتاجه والضوابط التي يتطلبها. هذا هو المخطط الذي يستند إليه كل شيء آخر.
2. Infrastructure-as-Code
بنية تحتية قابلة للاستنساخ ومُدارة بالإصدارات باستخدام أدوات مثل Terraform وCloudFormation. تصبح البيئات متسقة وقابلة للتدقيق وللتكرار، بدلاً من خوادم مُهيّأة يدوياً لا يفهمها أحد فهماً كاملاً. وحين يلزم تغيير شيء، تغيّر الشفرة بدل النقر عبر لوحة تحكّم على أمل أن ينجح الأمر.
3. نشر النماذج ومسارات MLOps
MLOps هو انضباط نقل النماذج إلى الإنتاج بموثوقية والحفاظ على سلامتها. وركائزه هي إدارة الإصدارات (لتعرف تحديداً ما الذي يعمل)، والتراجع (لتكون الإصدارة السيئة قابلةً للعكس)، ومسارات إعادة التدريب الآلية (ليواكب النموذج تحوّلات البيانات). فبدونها يتدهور النموذج بصمت حتى يتوقف الناس عن الوثوق به.
4. تحصين الأمان والامتثال
ضوابط وصول وتشفير وتهيئات جاهزة للامتثال مدمَجة منذ اليوم الأول، لا مضافة لاحقاً بعد تدقيق. وبالنسبة لأحمال العمل المنظَّمة والحساسة للبيانات، ليست الحوكمة ميزةً تضيفها لاحقاً؛ بل جزء من البنية المعمارية.
5. تحسين التكلفة والتوسّع التلقائي
تحجيم أمثل وتوسّع تلقائي وضوابط تكلفة ذكية تبقي الأداء مرتفعاً والإنفاق متوقَّعاً. فبإمكان فواتير الذكاء الاصطناعي أن تتصاعد بسرعة، وكبحها دون الإضرار بالأداء مهمة هندسية لا فكرة تُؤجَّل.
6. المراقبة والاستجابة للحوادث
مراقبة وتنبيه متواصلان وخطة لِما يحدث حين يتعطّل شيء، بحيث تُكتشَف المشكلات وتُحلّ قبل أن تصل إلى مستخدميك. فالذكاء الاصطناعي الإنتاجي نظام حيّ، ويحتاج إلى مراقبة تليق بذلك.
ما الذي يمنعه MLOps
يفيد أن ترى MLOps من خلال الإخفاقات التي يزيلها:
- النموذج الذي يتقادم بصمت. تنحرف البيانات، وتتراجع الدقة، ولا يلاحظ أحد لأن شيئاً لا يُراقَب. مسارات إعادة التدريب والمراقبة توقف هذا.
- الإصدارة التي لا يمكنك التراجع عنها. تسيء إصدارة نموذج جديدة التصرّف ولا يوجد سبيل نظيف للعودة. إدارة الإصدارات والتراجع توقف هذا.
- البيئة التي لا يستطيع أحد استنساخها. تعمل في بيئة الاختبار، وتتعطّل في الإنتاج، ولا يستطيع أحد تفسير السبب. Infrastructure-as-Code يوقف هذا.
- الفاتورة التي تفاجئ المدير المالي. ترتفع التكاليف دون رؤية أو تحكّم. التوسّع التلقائي وحوكمة التكلفة يوقفان هذا.
كل واحدة من هذه سبب رئيسي لفشل مشاريع الذكاء الاصطناعي بعد بداية واعدة، كما نتناول في لماذا تفشل 95% من مشاريع الذكاء الاصطناعي التجريبية. وMLOps هو الطريقة التي يتجنّبها بها القلّة الناجحة.
أين يقع هذا في برنامجك للذكاء الاصطناعي
البنية التحتية هي المرحلة الأخيرة من خطة تبنٍّ سليمة، لا الأولى. فأنت تختار حالة الاستخدام الصحيحة وتثبتها، ثم تمنحها موطناً إنتاجياً، وهو التسلسل الموضَّح في خارطة طريق تبنّي الذكاء الاصطناعي للمؤسسات. فبناء هذه البنية قبل أن تملك حالة استخدام مُتحقَّقاً منها أمر سابق لأوانه؛ وتوسيع حالة مُتحقَّق منها دونها هو ما يجعل 74% من الشركات العاجزة عن تجاوز المرحلة التجريبية تعلق في مكانها.
كيف تشغّل MedGAN AI الذكاء الاصطناعي على AWS
تصمّم خدمة البنية التحتية السحابية للذكاء الاصطناعي من MedGAN AI الركائز الست جميعها وتنشرها وتشغّلها، بتنفيذ فريق معتمد من AWS. نحن شركة ذكاء اصطناعي مقرّها عمّان، الأردن، وعضو في NVIDIA Inception Program، ونبني سحابةً بحجم مناسب للذكاء الاصطناعي: فعّالة التكلفة، قابلة للمراقبة، آمنة، وجاهزة للامتثال منذ أول نشر.
يمرّ تعاوننا بمراحل التقييم ثم التصميم المعماري ثم التزويد ثم التشغيل والتحسين: نراجع أحمال عملك واحتياجات الامتثال لديك، ونصمّم بنية AWS بحجم مناسب لها، ونبنيها بوصفها Infrastructure-as-Code، ثم نراقب ونحصّن ونحسّن التكلفة على مدار الساعة مع توسّع استخدامك. وبالنسبة للفرق التي انفلت إنفاقها السحابي أصلاً، غالباً ما يبدأ العمل نفسه بوصفه إنقاذاً للتكلفة. ولأن مهندسي السحابة لدينا يعملون جنباً إلى جنب مع الفريق الذي يبني النماذج، تُصمَّم أنظمة الذكاء الاصطناعي المخصصة والبنية التحتية تحتها معاً، لا أن تُتناقل بين مورّدين. تحدّث إلى فريقنا لمراجعة إعدادك.
الأسئلة الشائعة
ما MLOps؟
MLOps هو ممارسة نشر نماذج تعلّم الآلة في الإنتاج والحفاظ على سلامتها. وهو يشمل إدارة إصدارات النماذج، والتراجع، وإعادة التدريب الآلية، والمراقبة، والمسارات التي تنقل النموذج من التطوير إلى استخدام إنتاجي موثوق.
لماذا تنشر الذكاء الاصطناعي على AWS؟
تقدّم AWS اتساع خدمات الحوسبة والبيانات والذكاء الاصطناعي التي تحتاجها أحمال العمل الإنتاجية، بأمان بمستوى المؤسسات ونطاق عالمي. وعند استخدامها بشكل صحيح على يد فريق معتمد، تقدّم أداء GPU والحوكمة وضبط التكلفة الذي يتطلبه الذكاء الاصطناعي.
لماذا تفشل نماذج الذكاء الاصطناعي بعد النشر؟
من الأسباب الشائعة انحراف النموذج دون إعادة تدريب، وغياب التراجع عند إساءة إصدارةٍ التصرّف، وبيئات لا يمكن استنساخها، وتكاليف منفلتة. صُمّمت MLOps والبنية التحتية جيدة المعمار لمنع كلّ واحد من هذه.
هل تستطيع MedGAN AI تحسين تكاليف AWS الحالية لدينا؟
نعم. تحجّم MedGAN AI الموارد بدقة، وتطبّق التوسّع التلقائي، وترسّخ ضوابط تكلفة ذكية لكبح الإنفاق السحابي مع الحفاظ على الأداء والموثوقية سليمَين، وهي نقطة انطلاق شائعة للفرق التي نمت تكاليف ذكائها الاصطناعي على نحو غير متوقَّع. تحدّث إلى فريقنا للبدء.

