رامین حیدرزاده آذر

رامین حیدرزاده آذر

عنوان پایان‌نامه

پیش بینی نرخ ریزش در برخی قراردادهای بیمه در ایران با استفاده از تکنیکهای یادگیری ماشین



    رشته تحصیلی
    بيمه
    مقطع تحصیلی
    دکتری تخصصی PhD
    ساعت دفاع

    چکیده

    این مطالعه به چالش ریزش مشتری در بیمه عمر می‌پردازد که منجر به زیان‌های مالی قابل‌توجهی می‌شود. در این پژوهش، یک چهارچوب یادگیری ماشینِ شفاف، بازتولیدپذیر و عاری از نشت داده معرفی شده است که برای شناسایی دقیق و کارآمد بیمه‌گذارانی که در معرض ترک خدمات هستند، طراحی شده است. با استفاده از ??,??? بیمه‌نامه عمر ناشناس‌سازی شده ایرانی با نرخ ریزش ???، این مطالعه یک خط لوله مدل‌سازی کامل را توسعه داده است. این مسیر شامل مراحل جایگذاری داده‌های پرت، استانداردسازی و کدگذاری است که منحصراً در فرآیند آموزش انجام شده‌اند تا از نشت داده جلوگیری شود. سه نوع مدل شامل رگرسیون لجستیک، جنگل تصادفی و XGBoost آموزش دیده‌اند و با استفاده از روش اعتبار‌سنجی متقاطع طبقه‌بندی‌شده، آستانه‌های بهینه‌شده برای شاخص F۱ و معیارهای عملکردی نظیر ROC-AUC، F۱ و دقت مورد ارزیابی قرار گرفتند. نتایج نشان می‌دهد که تمامی مدل‌ها عملکرد مشابهی دارند، که در این میان رگرسیون لجستیک بالاترین امتیاز F۱ (معادل ?.??) و مدل XGBoost بهترین دقت (?.??) را ارائه داده‌اند. پیش‌بینی‌های برتر حدود ??? از ریزش‌کنندگان را شناسایی کردند که نشان‌دهنده پتانسیل عملیاتی قوی است. بیمه‌گذارانی با تأخیرهای طولانی در پرداخت، به عنوان مستعدترین و شناسایی‌پذیرترین گروه در برابر ریزش شناخته شدند. به‌طور کلی، یافته‌ها تأیید می‌کنند که مدل‌های یادگیری ماشین شفاف و تفسیرپذیر می‌توانند به طور مؤثری تعادل میان دقت، سادگی و کاربردی بودن را برقرار کنند؛ امری که از استراتژی‌های حفظ مشتری داده‌محور و ارزش‌محور در صنعت بیمه عمر حمایت می‌کند.

    Abstract

    This study tackles the challenge of customer churn in life insurance, which leads to substantial financial losses. It introduces a tra  arent, reproducible, and leakage-free machine learning framework designed to identify at-risk policyholders accurately and efficiently. Using ۲۰,۰۰۰ anonymized Iranian life insurance policies with a churn rate of ۲۶%, the study develops a complete modeling pipeline that includes imputation, standardization, and encoding steps performed strictly within the training process to prevent data leakage. Three model types—logistic regression, random forest, and XGBoost—were trained and evaluated using stratified cross-validation, F۱-optimized thresholds, and performance metrics such as ROC-AUC, F۱, and precision. Results show that all models perform similarly (ROC-AUC ? ۰.۷۰), with logistic regression achieving the highest F۱ score (۰.۶۶) and XGBoost offering the best precision (۰.۶۸). The top-ranked predictions captured about ۶۹% of churners, demonstrating strong operational potential. Policyholders with major payment delays were identified as the most churn-prone and easily detectable group. Overall, the findings confirm that tra  arent and interpretable machine learning models can effectively balance accuracy, simplicity, and practicality—supporting data-driven, value-focused customer retention strategies in the life insurance industry.