رامین حیدرزاده آذر
پیش بینی نرخ ریزش در برخی قراردادهای بیمه در ایران با استفاده از تکنیکهای یادگیری ماشین
- دانشجو
- رامین حیدرزاده آذر
- استاد راهنما
- غدیر مهدوی
- استاد مشاور
- رضا افقی
- استاد داور
- سعید صحت, علیرضا دقیقی اصلی, سیده رقیه ادهمی
- رشته تحصیلی
- بيمه
- مقطع تحصیلی
- دکتری تخصصی PhD
- ساعت دفاع
- چکیده
-
این مطالعه به چالش ریزش مشتری در بیمه عمر میپردازد که منجر به زیانهای مالی قابلتوجهی میشود. در این پژوهش، یک چهارچوب یادگیری ماشینِ شفاف، بازتولیدپذیر و عاری از نشت داده معرفی شده است که برای شناسایی دقیق و کارآمد بیمهگذارانی که در معرض ترک خدمات هستند، طراحی شده است. با استفاده از ??,??? بیمهنامه عمر ناشناسسازی شده ایرانی با نرخ ریزش ???، این مطالعه یک خط لوله مدلسازی کامل را توسعه داده است. این مسیر شامل مراحل جایگذاری دادههای پرت، استانداردسازی و کدگذاری است که منحصراً در فرآیند آموزش انجام شدهاند تا از نشت داده جلوگیری شود. سه نوع مدل شامل رگرسیون لجستیک، جنگل تصادفی و XGBoost آموزش دیدهاند و با استفاده از روش اعتبارسنجی متقاطع طبقهبندیشده، آستانههای بهینهشده برای شاخص F۱ و معیارهای عملکردی نظیر ROC-AUC، F۱ و دقت مورد ارزیابی قرار گرفتند. نتایج نشان میدهد که تمامی مدلها عملکرد مشابهی دارند، که در این میان رگرسیون لجستیک بالاترین امتیاز F۱ (معادل ?.??) و مدل XGBoost بهترین دقت (?.??) را ارائه دادهاند. پیشبینیهای برتر حدود ??? از ریزشکنندگان را شناسایی کردند که نشاندهنده پتانسیل عملیاتی قوی است. بیمهگذارانی با تأخیرهای طولانی در پرداخت، به عنوان مستعدترین و شناساییپذیرترین گروه در برابر ریزش شناخته شدند. بهطور کلی، یافتهها تأیید میکنند که مدلهای یادگیری ماشین شفاف و تفسیرپذیر میتوانند به طور مؤثری تعادل میان دقت، سادگی و کاربردی بودن را برقرار کنند؛ امری که از استراتژیهای حفظ مشتری دادهمحور و ارزشمحور در صنعت بیمه عمر حمایت میکند.
- Abstract
-
This study tackles the challenge of customer churn in life insurance, which leads to substantial financial losses. It introduces a tra arent, reproducible, and leakage-free machine learning framework designed to identify at-risk policyholders accurately and efficiently. Using ۲۰,۰۰۰ anonymized Iranian life insurance policies with a churn rate of ۲۶%, the study develops a complete modeling pipeline that includes imputation, standardization, and encoding steps performed strictly within the training process to prevent data leakage. Three model types—logistic regression, random forest, and XGBoost—were trained and evaluated using stratified cross-validation, F۱-optimized thresholds, and performance metrics such as ROC-AUC, F۱, and precision. Results show that all models perform similarly (ROC-AUC ? ۰.۷۰), with logistic regression achieving the highest F۱ score (۰.۶۶) and XGBoost offering the best precision (۰.۶۸). The top-ranked predictions captured about ۶۹% of churners, demonstrating strong operational potential. Policyholders with major payment delays were identified as the most churn-prone and easily detectable group. Overall, the findings confirm that tra arent and interpretable machine learning models can effectively balance accuracy, simplicity, and practicality—supporting data-driven, value-focused customer retention strategies in the life insurance industry.
