مرحبًا بك في دورة نوليدج سيتي التدريبية عن الشبكات العصبية وتصميم الشبكة العصبية. خلال هذه الدروس، ستتعرف على أهمية البيانات، أنواع الشبكات العصبية، تحديد نوع الشبكة المراد استخدامها، دوال التنشيط، دوال الخسارة والمحسنات، المعلمات الفائقة، الطبقات، التدريب والاختبار والتحقق من الصحة. ماذا ستتعلم. لماذا البيانات مهمة للشبكات العصبية؟ كيف ترتبط جودة البيانات لأداء الشبكة العصبية؟ لماذا من المهم النظر في القضايا الأخلاقية مع البيانات التي تستخدمها في الشبكات العصبية؟ لذا أولاً، لماذا تعتبر البيانات مهمة جدًا للشبكات العصبية؟ إذا كنت لا تتذكر أي شيء آخر عن الشبكات العصبية، يجب أن تتذكر هذا النمط، إذا دخلت القمامة سينتج عنها قمامة. في حال لم تكن معتادًا على هذه العبارة، هذا يعني في الأساس أنه إذا كنت تستخدم نوعية رديئة أو بيانات غير صحيحة، فستحصل على نتائج سيئة أو ذات جودة رديئة. الشبكة العصبية جيدة فقط مثل البيانات المستخدمة في التدريب. لهذا السبب، يجب أن تتجنب الكثير مما يلي عند اختيار بياناتك قدر الإمكان، البيانات الصاخبة والبيانات ذات الميزات والحالات أو المثيلات المرتبطة، البيانات ذات القيم المفقودة، بيانات مع ميزات وحالات أو مثيلات مكررة، البيانات ذات القيم التي لها أوامر متفاوتة من حيث الحجم. البيانات والشبكات العصبية والأخلاق. على الرغم من أن الشبكات العصبية يمكن أن تكون فعالة للغاية ومفيدة في عدد من الأنظمة، من المهم أن تضع في اعتبارك أن أدائهم يعتمد بشكل كبير على البيانات. في وقت سابق، ناقشنا بعض الأمثلة على البيانات المهملة. ومع ذلك، هناك نوع آخر من البيانات المهملة، البيانات المتحيزة. قد لا يحتوي هذا النوع من البيانات على أي من الصفات لتجنب الذي سبق مناقشته، ولكن يمكن أن يؤدي إلى مصنفات وعوامل انحدار وغير أخلاقية. البيانات المتحيزة هي البيانات المنحرفة أكثر في اتجاه فئة أو ميزة معينة. المزيد والمزيد من استخدامات وتطبيقات الشبكة العصبية التي تنطوي على البشر يجري استكشافها وتنفيذها. لهذا السبب، البيانات المستخدمة لتدريب الشبكات تحتوي على الكثير من المعلومات المتعلقة بالتركيبة السكانية مثل العرق والعمر والأثنية، التوجه الجنسي، وغيرها من الصفات. في الحالات التي يتم فيها استخدام الشبكات لتصنيف فرد معين بناءً على واحدة أو بعض أو كل هذه الصفات أو الملامح، من السهل إنشاء شبكة الملفات الشخصية بدلاً من التصنيف. من أجل تجنب هذه القضايا الأخلاقية، عند اختيار البيانات المستخدمة لتدريب نموذج من المهم أن يكون لديك مواقف متساوية ومثالية أو تمثيل شبه متساو لجميع الديموغرافيات في جميع الفئات. من المهم تذكر أهمية الخصوصية عند اختيار البيانات المراد استخدامها وتدريبها في شبكاتك أيضًا. فقط لأنك قادر على الحصول على المعلومات عن فرد أو كيان لا يعني أنهم يريدون منك استخدام تلك المعلومات للمساعدة في تصنيف أنفسهم أو الآخرين. فيما يلي بعض الأمثلة في بايثون باستخدام مستقبل طبقة واحدة perceptron في مجموعة بيانات سرطان الثدي. أولًا، لدينا تعريفات الدوال فقط. بعد ذلك، سأقوم بتحميل مجموعة بيانات سرطان الثدي وطباعة الدقة. لذا كما ترون هنا، درجة الاختبار حوالي 90، 91٪. ونسبة التدريب حوالي 92، 93٪. لذا الآن لدي بيانات مكررة. وما أفعله هنا، هو أني فقط أقوم بإنشاء نسخة مكررة من جميع الصفات في مجموعة البيانات. فبدلاً من 30 ميزة، لديك 60 ميزة، ولكن هناك ميزتان متطابقتان لكل ميزة. والآن سأقوم بتدريب النموذج مرة أخرى. وما ستراه هو درجات التدريب والاختبار كلاهما انخفض. الآن، هذا مثير للاهتمام بشكل خاص لأنني لا أقدم في الواقع أي بيانات جديدة، فقط المزيد من نفس البيانات، ومع ذلك فقد تسبب في أداء المصنف بشكل أسوأ. بعد ذلك، سأقوم بعمل مثال بيانات صاخبة. وفي هذه الحالة، أنا فقط أضيف ضوضاء عشوائية إلى بيانات الإدخال. وبعد ذلك سأقوم بتدريب النموذج مرة أخرى. الآن، كما ترون هنا، انخفضت نتيجة الاختبار ودرجة التدريب مرة أخرى، ليس بنفس القدر مع البيانات المكررة، لكنه كان لا يزال انخفاضًا. شيء واحد مهم أن نلاحظه هنا هو أن مجموعة بيانات سرطان الثدي هي مجموعة بيانات نظيفة للغاية. لذا، بغض النظر عن مدى ضعف مجموعة البيانات وصخبها، ستظل تحصل على نتائج جيدة إلى حد ما. ولكن إذا كانت هذه مجموعة بيانات أقل نظافة، وهو على الأرجح ما ستعمل معه عمليًا، فهذه الأشياء يمكن أن تسبب انخفاض أكبر في الأداء. وأخيرًا، لدينا مثال على البيانات المترابطة. لذا أقوم هنا بإضافة نفس البيانات بضربها بمعامل 2.7. لذا فهي في الحقيقة نفس البيانات، تم تغيير حجمها بشكل مختلف. وكما ترى، انخفضت نتيجة الاختبار مرة أخرى كما انخفضت درجة التدريب. والآن سأقوم بتطبيق كل النتائج حتى تتمكن من رؤية ما حدث. وهكذا فإن الخط الأزرق هو لنتائج الاختبار والخط الأخضر لنتائج التدريب. لذا كما ترى النسخة الأصلية، وهي مجموعة البيانات النظيفة العادية فقط ولا توجد نسخ مكررة، لا ضوضاء، لا ارتباط، تتفوق على جميع مجموعات البيانات الأخرى. بهذا ينتهي هذا الدرس. شكرا لك.