تطوير البرمجيات
تعلم الآلة باستخدام Python وscikit-learn
بناء النموذج هو الجزء السهل، أما الوثوق بالنتيجة المعلنة فليس كذلك. يغطي هذا البرنامج على مدى خمسة أيام خطوط المعالجة في scikit-learn والتحقق المتقاطع الأمين وأنماط تسرب البيانات التي تضخّم النتائج واختلال توازن الفئات واختيار العتبة ومعايرة الاحتمالات وأعمال التفسير التي تتيح للمؤسسة التصرف بناءً على التنبؤ.
نظرة عامة
تعلم عملي قابل للتطبيق في بيئة العمل.
معظم النماذج التي تخيب في الإنتاج لم تكن يوماً بجودة ما ادّعته نتيجة التحقق. مقياس مُدرَّب قبل التقسيم، أو خاصية مشتقة من الهدف، أو خلط عشوائي مطبَّق على بيانات مرتبة زمنياً، أو نسبة دقة معلنة على مجموعة سلبية بنسبة ثمانية وتسعين بالمئة: كل حالة من هذه تنتج رقماً يتعذر إعادة إنتاجه فور وصول البيانات الحقيقية. يجعل هذا البرنامج انضباط التقييم هي المهارة الجوهرية ويجعل اختيار المقدِّر تفصيلاً لاحقاً. يبني المشاركون كل نموذج داخل Pipeline وColumnTransformer ليعاد تدريب المعالجة المسبقة في كل طية، ويختارون مخططات تحقق تحترم البنية الزمنية والمجموعات، ويضبطون المعاملات ببحث متداخل، ويحددون عتبة تشغيلية وفق مصفوفة تكلفة حقيقية، ويعايرون الاحتمالات قبل استخدامها كدرجات مخاطرة.
المتطلبات المسبقة
إتقان جيد للغة Python ومكتبة pandas إضافة إلى الإلمام بالإحصاء الوصفي، ولا تُشترط خبرة سابقة في النمذجة.
الأهداف
- ترجمة سؤال العمل إلى مهمة تعلّم موجّه بهدف قابل للقياس.
- تركيب المعالجة المسبقة والمقدِّرات داخل كائنات Pipeline وColumnTransformer.
- تحديد أنماط تسرب البيانات التي تضخّم نتائج التحقق وإزالتها.
- اختيار مخططات تحقق متقاطع تحترم الترتيب الزمني وبنية المجموعات.
- معالجة اختلال توازن الفئات بإعادة العينات وأوزان الفئات والعتبات المراعية للتكلفة.
- معايرة النموذج وتفسيره وتغليفه لتسليمه إلى فريق الهندسة.
الفئة المستهدفة
- علماء البيانات الذين ينظّمون ممارسة نمذجة غير رسمية
- المحللون الكميون ومحللو المخاطر المنتقلون من النماذج الإحصائية إلى تعلم الآلة
- مهندسو البرمجيات المكلفون بتطوير خاصية تنبؤية
- مهندسو البيانات الذين ينقلون نماذج أنشأها غيرهم إلى الإنتاج
- فرق الصيانة وتخطيط الطلب والائتمان التي تقيّم حالات استخدام تنبؤية
- القادة التقنيون الذين يراجعون نتائج النماذج قبل بناء القرارات عليها
محاور البرنامج
هيكل واضح لرحلة التعلم.
محاور البرنامج
تظهر محاور البرنامج في صندوق واحد بدلاً من تحويل كل سطر إلى وحدة منفصلة.
الوحدة 1: تأطير المشكلة ومجموعة البيانات
تحديد تعريف الهدف وأفق التنبؤ بما يمكن للمؤسسة التصرف بناءً عليه
الانحدار والتصنيف والترتيب: مواءمة المهمة مع القرار
خطوط الأساس عبر DummyClassifier وDummyRegressor قبل أي نموذج فعلي
استراتيجية التقسيم: عشوائي أو طبقي أو حسب المجموعات أو زمني
الوحدة 2: خطوط المعالجة وColumnTransformer وتحضير الخصائص
لماذا يؤدي تدريب المقياس أو المُكمِّل خارج خط المعالجة إلى تسريب مجموعة الاختبار
تحجيم العددية والتكميل والترميز الآمن للمتغيرات الفئوية
الترميز OneHot والترتيبي وترميز الهدف وحدودها عند العددية العالية
المحوّلات المخصصة عبر FunctionTransformer وواجهة المقدِّر
الوحدة 3: الخوارزميات الموجّهة ومفاضلاتها
الانحدار الخطي واللوجستي مع التنظيم L1 وL2
أشجار القرار والغابات العشوائية وحدود جدوى خفض التباين
التعزيز التدرّجي: مقارنة HistGradientBoosting وXGBoost
قراءة سلوك الانحياز والتباين من منحنيات التعلم والتحقق
الوحدة 4: التحقق وتسرب البيانات والبحث عن المعاملات الفائقة
اختيار KFold وStratifiedKFold وGroupKFold وTimeSeriesSplit بحسب بنية البيانات
تسرب الهدف وتلوث بيانات التدريب والاختبار وخصائص غير متاحة وقت التنبؤ
GridSearchCV وRandomizedSearchCV وHalvingSearchCV ضمن ميزانية حوسبة محددة
التحقق المتقاطع المتداخل للحصول على تقدير غير منحاز للأداء بعد الضبط
الوحدة 5: الاختلال والعتبات والمعايرة
لماذا لا معنى للدقة في بيانات الأحداث النادرة وما البديل الذي يُبلَّغ عنه
أوزان الفئات وSMOTE وتقليل العينات وآثارها الجانبية
منحنيات الدقة والاستدعاء وROC AUC واختيار العتبة من مصفوفة التكلفة
معايرة الاحتمالات عبر مقياس Platt والانحدار المتساوي ومنحنيات الموثوقية
الوحدة 6: التفسير والتغليف والتسليم
الأهمية بالتبديل والاعتماد الجزئي وقراءتهما قراءة صحيحة
قيم SHAP للتنبؤات الفردية وحدود استخدامها في التواصل
حفظ النماذج عبر joblib وتثبيت الإصدارات وتسجيل بيانات التدريب الوصفية
مراقبة الانحراف وتحديد مُطلِق إعادة التدريب قبل التشغيل
المواد المقدمة
- دليل الدورة وأمثلة شيفرة موثّقة وملاحظات مرجعية
- بيئة معملية عملية ومستودعات بداية جاهزة
- تمارين وقوائم تحقق وقوالب شيفرة قابلة لإعادة الاستخدام
- شهادة إتمام من 4D
- دعم فني بعد انتهاء البرنامج
خيارات التدريب
يمكن تقديم البرامج داخل مقر المؤسسة، أو عن بُعد، أو بصيغة مدمجة بحسب جدول الفريق وموقعه وأهداف التعلم. عندما يتضمن البرنامج شهادة أو اختباراً من جهة خارجية، تبقى قواعد الشهادة ورسومها خاضعة لسياسات الجهة المانحة، بينما تقدم 4D التدريب ودعم التحضير.
لماذا البعد الرابع
تبني 4D هذا البرنامج حول إحدى حالات الاستخدام المرشحة لديكم: تسرب العملاء أو قرارات الائتمان أو التنبؤ بالطلب أو التنبؤ بالأعطال. يدقق المدربون أولاً في البيانات التاريخية بحثاً عن التسرب وجودة التصنيف، ثم يبنون خط المعالجة مع محلليكم، ويتفقون على العتبة التشغيلية مع المسؤول الذي سيتصرف بناءً على المخرجات، ليخرج النموذج مصحوباً بقاعدة قرار قابلة للدفاع عنها.
دورات ذات صلة
أساسيات البرمجة بلغة Python
مقدمة عملية إلى Python للمهندسين والمحللين الذين يحتاجون شيفرة تعمل فعلاً لا مقتطفات تعليمية. يكتسب المشاركون طلاقة في أنواع البيانات والمجموعات والدوال والملفات ومعالجة الأخطاء، ثم يبنون برنامجاً صغيراً يقرأ بيانات حقيقية وينتج تقريراً قابلاً للاستخدام.
View coursePython المتوسط وممارسات الشيفرة النظيفة
برنامج موجّه للمطورين الذين تعمل شيفرة Python لديهم لكن يصعب تغييرها. يغطي dataclasses والمولّدات والمزخرفات ومديري السياق وتلميحات الأنواع، ثم يطبّق خطوات إعادة الهيكلة التي تحوّل وحدة من تسعمئة سطر إلى وحدات صغيرة مختبَرة تحرسها أدوات black وruff وmypy.
View courseأتمتة المهام المكتبية والبرمجة النصية بلغة Python
برنامج موجّه للفرق التي تهدر ساعات أسبوعية في أعمال متكررة على الملفات والجداول والتقارير. يقوم المشاركون بأتمتة هذه المهام باستخدام Python: معالجة الملفات دفعياً وجداول Excel وCSV واستدعاء واجهات REST وتنبيهات البريد والمهام المجدولة التي تعمل دون إشراف وتبلّغ بوضوح عند الفشل.
View course