معصومه قنبرپور
عنوان پایاننامه
به کارگیری مدل های یادگیری ماشین در تشخیص اشعار تولید شده توسط مدل های زبانی بزرگ از سروده های انسانی
- رشته تحصیلی
- علوم كامپيوتر- گرايش محاسبات نرم و هوش مصنوعي
- مقطع تحصیلی
- کارشناسی ارشد
- محل دفاع
- علوم ریاضی و رایانه
- شماره ساختمان محل ارائه
- ۸۷
- نام کلاس محل ارائه
- کلاس ۱۰۱[۳۱۱۰۱]
- شماره کلاس محل ارائه
- ۱۰۱
- تاریخ دفاع
- ۲۹ بهمن ۱۴۰۴
- ساعت دفاع
- ۱۴:۰۰
- چکیده
- امروزه مدلهای زبانی بزرگ میتوانند محتوایی بسیار شبیه به متن انسانی تولید کنند. یکی از زمینههای آن، تولید متون خلاقانه، بهویژه شعر است که بهدلیل پیچیدگیهای زبانی و زیباییشناختی، تشخیصدادن آن از شعر انسانی همواره یک چالش بوده است. ازآنجا که پژوهشهای پیشین فاقد مقایسة روشمند یادگیری ماشین سنتی و رویکردهای یادگیری عمیق برای تشخیص شعر ماشینی از انسانی است، در این پژوهش ما با جمعآوری مجموعهدادههای متوازن آموزش (۵۰۰۰ نمونه) و دو مجموعهدادة آزمون درونتوزیع و برونتوزیع(هرکدام با ۱۰۰۰ نمونه) از شعرهای سرودة انسان و تولیدات مدلهای زبانی بزرگ، پس از آموزش مدلهایگوناگون، عملکرد مدلهای مبتنیبرویژگی و مدلهای یادگیری عمیق در وظیفة تشخیص شعر ماشینی از انسانی را ارزیابی کردهایم و درنهایت با تطبیقدادن فرادادههای جمعآوریشده تحلیل جامعی از عملکرد مدلهای دستهبندی، و کارایی جاسازیها در این وظیفه و قابلیتهای تولید شعر مدلهای زبانی ارائه دادهایم. در مرحلة ارزیابی این پژوهش، جاسازی ادغامشده از ویژگیهای برت و تیافآیدیاف بالاترین عملکرد را بین مدلهایبرپایة ویژگی نشان داد. در مقایسه با همة مدلهای ارزیابیشده، مدل بردار پشتیبان غیرخطی به بالاترین دقت ۰.۹۴۳ و پس از آن مدل روبرتا به دقت ۰.۹۳۵ رسید. همچنین پس از مقایسة عملکرد این دو مدل نهایی در آستانههای مختلف، روبرتا عملکرد منسجمتر و قابلاطمینانتری در تمامی آستانههای تصمیمگیری نشان داد. افزونبراین، ارزیابیهای ما نشان داده است زمانی که کاربرد و هدف (با تحمل مثبتهای کاذب)، تشخیصکوچکترین مورد مشکوکی را ایجاب کند (آستانة پایین: ۰.۱)، بردار پشتیبان غیرخطی (با کسب یادآوری ۰.۹۸۴) قویتر از روبرتا (با یادآوری ۰.۹۲۴) عمل میکند.
- Abstract
- In recent years, large language models have becomecapable of generating content that closely resembles human-written texts. Onesuch domain is creative text generation—particularly poetry—which, due to itslinguistic and aesthetic complexity, has always posed a significant challengefor distinguishing machine-generated poems from those written by humans. Giventhat prior research lacks a systematic comparison between traditional machinelearning methods and deep learning approaches for detecting machine-generatedversus human-authored poetry, this study addresses this gap by collectingbalanced train, in-distribution and out-of-distribution test datasetsconsisting of both human-written and machine-generated poems. After trainingvarious models, we evaluate the performance of feature-based models and deeplearning models on the task of classifying poetry generated by large languagemodels versus humans. Finally, by aligning and analyzing the collectedmetadata, we provide a comprehensive analysis of the classification models’performance, the effectiveness of different embeddings for this task, and thepoetry generation capabilities of large language models. During theevaluation phase, the combined embedding of BERT features and TF–IDF achievedthe highest performance among all feature-based models. Among all evaluatedmodels, the RBF Support Vector Machine attained the highest accuracyof ۰.۹۴۳, followed by the RoBERTa model with an accuracy of ۰.۹۳۵. Furthermore,comparison of model performance across different decision thresholds revealedthat RoBERTa exhibited more consistent and reliable performance across allthresholds. However, in applications where the objective tolerates falsepositives and requires detection of even the smallest suspicious cases (lowthreshold: ۰.۱), the RBF SVM outperformed RoBERTa, achieving a recall of ۰.۹۸۴compared to RoBERTa’s recall of ۰.۹۲۴.
