>
Fa   |   Ar   |   En
   ارزیابی عملکرد مدلclipدر تطبیق تصویر و متن در زبان فارسی: چالش ها و راهکارها  
   
نویسنده اسکندری محتشمه ,کیوانلو شهرستانکی زهرا
منبع هفتمين كنفرانس ملي دستاوردهاي نوين در برق، كامپيوتر و صنايع - 1404 - دوره : 7 - هفتمین کنفرانس ملی دستاوردهای نوین در برق، کامپیوتر و صنایع - کد همایش: 04250-96281 - صفحه:0 -0
چکیده    در سال‌های اخیر، مدل‌های چندوجهی مانند clip، gpt-4vو gemini نقش مهمی در توسعه هوش مصنوعی ایفا کرده‌اند. این مدل‌ها با هدف تحلیل همزمان داده‌های تصویری، متنی، صوتی و ویدئویی، امکان درک عمیق‌تری از محیط را برای سامانه‌های هوشمند فراهم می‌سازند. با وجود پیشرفت‌های چشمگیر، عملکرد این مدل‌ها در زبان‌های کم‌منبع مانند فارسی کمتر مورد ارزیابی دقیق قرار گرفته است. در این مقاله، یک چارچوب برای بررسی تجربی عملکرد مدل clip در تطبیق تصویر و متن فارسی طراحی و اجرا شده است. ابتدا مجموعه‌ای از تصاویر عمومی همراه با توضیحات فارسی و معادل‌های انگلیسی تهیه گردید. سپس مدل clip در حالت zero-shot روی این داده‌ها اجرا شد و امتیازهای شباهت کسینوسی بین تصویر و متن در دو زبان مقایسه گردید. نتایج نشان داد که مدل در زبان انگلیسی به‌طور میانگین امتیاز بالاتری کسب کرده و در زبان فارسی با افت نسبی دقت مواجه است. این تفاوت را می‌توان به ساختار نحوی خاص زبان فارسی، ترکیب‌های وصفی پیچیده، افعال مرکب، و نبود داده‌های فارسی در مرحله آموزش مدل نسبت داد. در پایان، پیشنهاداتی برای بهبود عملکرد مدل در زبان فارسی شامل آموزش مجدد، استفاده از مدل‌های چندزبانه، و طراحی مجموعه‌داده‌های بومی ارائه شده است
کلیدواژه هوش مصنوعی چندوجهی،clip، زبان فارسی، تطبیق تصویر و متن، شباهت کسینوسی، مدلهای چندزبانه
آدرس , iran, , iran
پست الکترونیکی z.keivanloo@gmail.com
 
   an evaluation of the clip model’s performance in persian image-text matching: challenges and approaches  
   
Authors
  
 
 

Copyright 2023
Islamic World Science Citation Center
All Rights Reserved