التعامل مع البياناتمجاني
بانداس
قراءة وفحص وتصفية وتلخيص البيانات الحقيقية باستخدام بايثون. من ملفات CSV إلى التجميع الإحصائي — ست خطوات واختبار من عشرة أسئلة في كل فصل.
الخطوات الست في كل فصل
- 1المشكلة
- 2الفهم
- 3أمثلة محلولة
- 4التوقع
- 5التطبيق
- 6التحدي
- 01تثبيت بانداس وجدولك الأوللا يأتي بانداس مدمجاً مع بايثون. إنشاء بيئة افتراضية، والتثبيت باستخدام pip، والتحقق منه، وبناء أول DataFrame بيدك.25 دقيقة١٠ أسئلة
- 02Series و DataFrame — المفهومان الأساسيان في بانداسما هو العمود وما هو الجدول، ولماذا يجب أن تتشارك كل قيم العمود نوعاً واحداً. مع توضيح الفرق الجوهري بين df["col"] و df[["col"]].30 دقيقة١٠ أسئلة
- 03قراءة ملف CSV وفحص البيانات بعد قراءتهاقراءة الملفات باستخدام read_csv وفحصها مباشرة عبر shape و head و info و describe — لأن الملف المقروء بشكل غير سليم يعطي نتائج خاطئة دون إظهار أي أخطاء.30 دقيقة١٠ أسئلة
- 04اختيار الأعمدة والصفوف — بالاسم أو بالموضعتحديد جزء من الجدول: اختيار الأعمدة بالأقواس المربعة، والصفوف بالتسمية عبر loc وبالموضع عبر iloc، والخلايا المفردة عبر at — ومعرفة أي الطريقتين تستخدم دائماً.45 دقيقة١٠ أسئلة
- 05تصفية الصفوف — طرح السؤال نفسه على كل صفالاحتفاظ بالصفوف التي تطابق الشرط فقط: الأقنعة المنطقية (Boolean masks)، والربط باستخدام & و | و ~، ودوال isin و between وطرق .str، وتصفية الصفوف عبر .loc — وتعديل تلك الصفوف بأمان دون الوقوع في خطأ الإسناد المتسلسل.45 دقيقة١٠ أسئلة
- 06البيانات المفقودة — العثور على الفجوات وتحديد معناهاالعثور على كل فجوة في الجدول، بما في ذلك القيم المخفية كنصوص مثل - أو ؟، وفهم كيف يغير NaN عمليات الجمع والمتوسطات والأنواع، واتخاذ قرار مدروس عموداً بعمود — بحذف الفجوة أو ملئها أو الإبقاء عليها.45 دقيقة١٠ أسئلة
- 07ترتيب الصفوف — وتحديد كيفية التعامل مع حالات التعادلترتيب الصفوف باستخدام sort_values: لعمود واحد أو أعمدة متعددة، وباتجاه مستقل لكل عمود، والتعامل مع القيم المفقودة والنصوص الشبيهة بالأرقام — بالإضافة إلى nlargest لأعلى القيم، ولماذا يجب أن يكون التعادل عند حد القطع قراراً مقصوداً لا مجرد صدفة.40 دقيقة١٠ أسئلة
- 08التجميع والإحصاء — إجابة واحدة لكل مجموعةتحويل أسئلة من قبيل "لكل فرع" و"لكل فئة" و"لكل يوم" إلى سطر واحد باستخدام groupby: المفتاح، وعمود القيمة، ودالة التجميع، وحساب قيم متعددة عبر named agg، والفرق بين size و count، ومفتاحان للتجميع، وفخ متوسط المتوسطات.45 دقيقة١٠ أسئلة
- 09إضافة الأعمدة — استخراج الأرقام غير الموجودة في الملفإنشاء أعمدة جديدة من الأعمدة الحالية: العمليات الحسابية على الأعمدة بالكامل ودور الفهرس في مطابقة القيم، ودوال assign و np.where و np.select و map و pd.cut و .str و .dt، واستخدام transform للمقارنة مع المجموعة، و apply كملاذ أخير.50 دقيقة١٠ أسئلة
- 10دمج كائنات DataFrame — الرصف باستخدام concat والمطابقة باستخدام mergeجمع الجداول معاً: رصف بيانات الأشهر المتشابهة رأسياً باستخدام concat، وإضافة معلومات من جدول آخر باستخدام merge — اختيار نوع الدمج المناسب، ومعرفة الصفوف غير المتطابقة، واكتشاف المفاتيح المكررة التي تضاعف الصفوف بصمت.50 دقيقة١٠ أسئلة