تحليل بيانات التأمين الصحي باستخدام التعلم الآلي للتنبؤ بالتكاليف الطبية

مشروع تحليل بيانات التأمين الصحي باستخدام التعلم الآلي

قمت في هذا المشروع بتحليل بيانات التأمين الصحي لتحديد العلاقة بين العوامل المختلفة (مثل العمر، مؤشر كتلة الجسم، وحالة التدخين) والتكاليف الطبية المتوقعة. المشروع شمل:

تحليل بصري للبيانات:

استخدام مكتبة Seaborn لإنشاء رسوم بيانية تظهر العلاقة بين متغيرات مثل العمر وBMI مع التكاليف الطبية.

تمييز تأثير المدخنين على التكاليف.

معالجة البيانات:

تحويل البيانات النصية مثل الجنس وحالة التدخين إلى قيم رقمية باستخدام أدوات التشفير (Label Encoding).

تقسيم البيانات إلى مجموعات للتدريب والاختبار.

بناء نموذج تعلم آلي:

تدريب نموذج انحدار خطي لتوقع التكاليف الطبية.

تقييم الأداء باستخدام الأخطاء المربعة المتوسطة (MSE) ومعامل التحديد (R²).

نتائج المشروع:

تحقيق دقة عالية مع معامل تحديد بلغ 0.78، مما يعكس قدرة النموذج على التنبؤ بالتكاليف بشكل جيد.

هذا المشروع يُظهر مهاراتي في تحليل البيانات، بناء النماذج، والتعامل مع مكتبات Python مثل Pandas وMatp


مشروع جميل، وقراءة تأثير التدخين على التكاليف هي أهم ما فيه فعلاً.

نقطة قد ترفع R² عندك بلا تعقيد: في بيانات التأمين هذه، التكاليف لا تتوزع طبيعياً — ذيل طويل جهة المدخنين. جرّب الانحدار على log(charges) بدل charges مباشرة، فالانحدار الخطي يفترض تناسقاً في البواقي، والذيل الطويل يكسره. غالباً تقفز من 0.78 إلى ما فوق 0.85 بهذه الخطوة وحدها.

وملاحظة أدق: Label Encoding للجنس والتدخين لا مشكلة فيه لأنهما ثنائيان، لكن لو أدخلت المنطقة (region) بنفس الطريقة فسيفهمها النموذج ترتيباً رقمياً وهي ليست كذلك — هناك One-Hot أنسب.

وشكراً لأنك ذكرت MSE مع R² — كثيرون يكتفون بواحد.