|
|
|
|
ارزیابی عملکرد مدلclipدر تطبیق تصویر و متن در زبان فارسی: چالش ها و راهکارها
|
|
|
|
|
|
|
|
نویسنده
|
اسکندری محتشمه ,کیوانلو شهرستانکی زهرا
|
|
منبع
|
هفتمين كنفرانس ملي دستاوردهاي نوين در برق، كامپيوتر و صنايع - 1404 - دوره : 7 - هفتمین کنفرانس ملی دستاوردهای نوین در برق، کامپیوتر و صنایع - کد همایش: 04250-96281 - صفحه:0 -0
|
|
چکیده
|
در سالهای اخیر، مدلهای چندوجهی مانند clip، gpt-4vو gemini نقش مهمی در توسعه هوش مصنوعی ایفا کردهاند. این مدلها با هدف تحلیل همزمان دادههای تصویری، متنی، صوتی و ویدئویی، امکان درک عمیقتری از محیط را برای سامانههای هوشمند فراهم میسازند. با وجود پیشرفتهای چشمگیر، عملکرد این مدلها در زبانهای کممنبع مانند فارسی کمتر مورد ارزیابی دقیق قرار گرفته است. در این مقاله، یک چارچوب برای بررسی تجربی عملکرد مدل clip در تطبیق تصویر و متن فارسی طراحی و اجرا شده است. ابتدا مجموعهای از تصاویر عمومی همراه با توضیحات فارسی و معادلهای انگلیسی تهیه گردید. سپس مدل clip در حالت zero-shot روی این دادهها اجرا شد و امتیازهای شباهت کسینوسی بین تصویر و متن در دو زبان مقایسه گردید. نتایج نشان داد که مدل در زبان انگلیسی بهطور میانگین امتیاز بالاتری کسب کرده و در زبان فارسی با افت نسبی دقت مواجه است. این تفاوت را میتوان به ساختار نحوی خاص زبان فارسی، ترکیبهای وصفی پیچیده، افعال مرکب، و نبود دادههای فارسی در مرحله آموزش مدل نسبت داد. در پایان، پیشنهاداتی برای بهبود عملکرد مدل در زبان فارسی شامل آموزش مجدد، استفاده از مدلهای چندزبانه، و طراحی مجموعهدادههای بومی ارائه شده است
|
|
کلیدواژه
|
هوش مصنوعی چندوجهی،clip، زبان فارسی، تطبیق تصویر و متن، شباهت کسینوسی، مدلهای چندزبانه
|
|
آدرس
|
, iran, , iran
|
|
پست الکترونیکی
|
z.keivanloo@gmail.com
|
|
|
|
|
|
|
|
|
|
|
|
|
an evaluation of the clip model’s performance in persian image-text matching: challenges and approaches
|
|
|
|
|
Authors
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|