>
Fa   |   Ar   |   En
   ارزیابی خلاصه‌های تولید شده توسط llm با متریک های سنتی و معنایی: معرفی hybridscore  
   
نویسنده ورزشی سارا ,شریف احمد ,قبائی آرانی مصطفی
منبع اولين كنفرانس بين المللي هوش مصنوعي و فناوري هاي مرتبط - 1404 - دوره : 1 - اولین کنفرانس بین المللی هوش مصنوعی و فناوری های مرتبط - کد همایش: 04250-48654 - صفحه:0 -0
چکیده    در این پژوهش بر اهمیت استفاده از متریک‌های معنایی در ارزیابی سیستم های خلاصه‌سازی خودکار تمرکز دارد، با ترکیب کردن ویژگی های آن ها، افزایش دقت و جامعیت ارزیابی‌ها را ارتقا میدهد. با رشد مدل‌های زبانی و کاربرد آن‌ها در تولید خلاصه سازی متنی، نیاز به روش‌های ارزیابی دقیق تر بیش از پیش احساس می‌شود. در این راستا، عملکرد چهار متریک محبوب شامل rouge، bertscore، sbert و bleurt، تحلیل شدند تا کیفیت خلاصه‌های تولیدشده توسط مدل‌های زبانی پیشرفته سنجیده شود. چارچوبی تحلیلی طراحی گردید تا محاسبه دقت متریک‌ها در شاخص‌هایی نظیر مقایسه زمان اجرا، انحراف معیار (پایداری) و تحلیل میانگین نمرات که میتوانند در آینده مورد توسعه قرار بگیرد. متریک‌های مبتنی بر یادگیری عمیق، مانند bleurt ، از دقت بالاتری نسبت به روش‌های سنتی برخوردار است. با این حال، rouge سرعت پردازش بالاتری دارد، همچنان به‌عنوان گزینه‌ای مناسب برای کاربردهای بلادرنگ است. علاوه بر این، بررسی عملکرد متریک bleu که عمدتاً در ارزیابی ترجمه ماشینی به‌کار می‌رود. در جهت ایجاد توازنی میان دقت ارزیابی و سرعت پردازش، متریک ترکیبی با عنوان hybridscore معرفی شد. این متریک در ابتدا با ترکیب وزن دار از دو متریک bertscore و rouge به ترتیب به عنوان معیارهای معنایی و سطح واژگانی است. برای تعیین وزن ها، طی آزمایش هایی دو حالت پایه (وزن مساوی) و حالت بهینه سازی شده با استفاده از روش جستوجوی شبکه ای، سپس با ترکیب شدن sbert و افزایش همبستگی با bleurt بررسی شد. نتایج حاصل بر روی مجموعه داده scitldr (شامل 1000 نمونه خلاصه سازی علمی) نشان داد hybridscore در حالت بهینه توانسته عملکردی نزدیک به bleurt با هزینه محاسباتی کمتر و افزایش دقت را ارائه دهد، بنابراین، همچنین هدف از ترکیب کردن متریک های ارزیابی به دنبال روشی بهینه تر، سریع تر و تا حد ممکن با افزایش پایداری برای ارزیابی خلاصه سازی متون است.
کلیدواژه خلاصه‌سازی،مدل های زبانی بزرگ (llm)،متریک های ارزیابی،متریک های معنایی،پردازش زبان طبیعی (nlp)
آدرس , iran, , iran, , iran
پست الکترونیکی mostafaghobaye@yahoo.com
 
   evaluating llm-generated summaries with traditional and semantic metrics introducing hybridscore  
   
Authors
Abstract    this research underscores the critical role of semantic-based metrics in evaluating automatic text summarization systems. by integrating their complementary features, the accuracy and comprehensiveness of evaluations can be significantly enhanced. with the rapid advancement of large language models and increasing use in text generation and summarization, the demand for more reliable and fine-grained evaluation methods has become more pressing than ever. in this study, the performance of four widely adopted metrics __ rouge, bertscore, sbert and bleurt __ was systematically analyzes to assess the quality of summaries produced by advanced large language models. to facilitate this evaluation, an analytical framework was designed to examine metrics across dimensions such as execution time, standard deviation (stability), and average score analysis, with potential for further extension in future work.
Keywords summarization ,large language models ,evaluation metrics ,semantic metrics ,natural language processing.
 
 

Copyright 2023
Islamic World Science Citation Center
All Rights Reserved