|
|
|
|
ارزیابی خلاصههای تولید شده توسط llm با متریک های سنتی و معنایی: معرفی hybridscore
|
|
|
|
|
|
|
|
نویسنده
|
ورزشی سارا ,شریف احمد ,قبائی آرانی مصطفی
|
|
منبع
|
اولين كنفرانس بين المللي هوش مصنوعي و فناوري هاي مرتبط - 1404 - دوره : 1 - اولین کنفرانس بین المللی هوش مصنوعی و فناوری های مرتبط - کد همایش: 04250-48654 - صفحه:0 -0
|
|
چکیده
|
در این پژوهش بر اهمیت استفاده از متریکهای معنایی در ارزیابی سیستم های خلاصهسازی خودکار تمرکز دارد، با ترکیب کردن ویژگی های آن ها، افزایش دقت و جامعیت ارزیابیها را ارتقا میدهد. با رشد مدلهای زبانی و کاربرد آنها در تولید خلاصه سازی متنی، نیاز به روشهای ارزیابی دقیق تر بیش از پیش احساس میشود. در این راستا، عملکرد چهار متریک محبوب شامل rouge، bertscore، sbert و bleurt، تحلیل شدند تا کیفیت خلاصههای تولیدشده توسط مدلهای زبانی پیشرفته سنجیده شود. چارچوبی تحلیلی طراحی گردید تا محاسبه دقت متریکها در شاخصهایی نظیر مقایسه زمان اجرا، انحراف معیار (پایداری) و تحلیل میانگین نمرات که میتوانند در آینده مورد توسعه قرار بگیرد. متریکهای مبتنی بر یادگیری عمیق، مانند bleurt ، از دقت بالاتری نسبت به روشهای سنتی برخوردار است. با این حال، rouge سرعت پردازش بالاتری دارد، همچنان بهعنوان گزینهای مناسب برای کاربردهای بلادرنگ است. علاوه بر این، بررسی عملکرد متریک bleu که عمدتاً در ارزیابی ترجمه ماشینی بهکار میرود. در جهت ایجاد توازنی میان دقت ارزیابی و سرعت پردازش، متریک ترکیبی با عنوان hybridscore معرفی شد. این متریک در ابتدا با ترکیب وزن دار از دو متریک bertscore و rouge به ترتیب به عنوان معیارهای معنایی و سطح واژگانی است. برای تعیین وزن ها، طی آزمایش هایی دو حالت پایه (وزن مساوی) و حالت بهینه سازی شده با استفاده از روش جستوجوی شبکه ای، سپس با ترکیب شدن sbert و افزایش همبستگی با bleurt بررسی شد. نتایج حاصل بر روی مجموعه داده scitldr (شامل 1000 نمونه خلاصه سازی علمی) نشان داد hybridscore در حالت بهینه توانسته عملکردی نزدیک به bleurt با هزینه محاسباتی کمتر و افزایش دقت را ارائه دهد، بنابراین، همچنین هدف از ترکیب کردن متریک های ارزیابی به دنبال روشی بهینه تر، سریع تر و تا حد ممکن با افزایش پایداری برای ارزیابی خلاصه سازی متون است.
|
|
کلیدواژه
|
خلاصهسازی،مدل های زبانی بزرگ (llm)،متریک های ارزیابی،متریک های معنایی،پردازش زبان طبیعی (nlp)
|
|
آدرس
|
, iran, , iran, , iran
|
|
پست الکترونیکی
|
mostafaghobaye@yahoo.com
|
|
|
|
|
|
|
|
|
|
|
|
|
evaluating llm-generated summaries with traditional and semantic metrics introducing hybridscore
|
|
|
|
|
Authors
|
|
|
Abstract
|
this research underscores the critical role of semantic-based metrics in evaluating automatic text summarization systems. by integrating their complementary features, the accuracy and comprehensiveness of evaluations can be significantly enhanced. with the rapid advancement of large language models and increasing use in text generation and summarization, the demand for more reliable and fine-grained evaluation methods has become more pressing than ever. in this study, the performance of four widely adopted metrics __ rouge, bertscore, sbert and bleurt __ was systematically analyzes to assess the quality of summaries produced by advanced large language models. to facilitate this evaluation, an analytical framework was designed to examine metrics across dimensions such as execution time, standard deviation (stability), and average score analysis, with potential for further extension in future work.
|
|
Keywords
|
summarization ,large language models ,evaluation metrics ,semantic metrics ,natural language processing.
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|