
محققان دانشگاه پرینستون در پژوهشی جدید نشان دادهاند که بنچمارکها در ارزیابی هوش مصنوعی گمراهکننده میتوانند باشند. این تحقیقات با هدف در نظر نداشتن هزینهها در مدلهای هوش مصنوعی انجام شده و نشان دادهاند که این روشها برای برنامههای کاربردی در دنیای واقعی مفید نیستند.
بر اساس گزارشهای اخیر، سنجش مدلهای مختلف هوش مصنوعی با بنچمارکهای ثابت نمیتواند نتایج صحیح در دنیای واقعی ارایه دهد. یکی از مسائل مهمی که محققان بر آن پافشاری میکنند، عدم در نظر گرفتن شیوه کنترل هزینه در مدلهای هوش مصنوعی است.
بنچمارکهای گمراهکننده در ارزیابی هوش مصنوعی
برای افزایش دقت، برخی از سیستمهای هوش مصنوعی چندین جواب تشکیل میدهند و از مکانیسمهای مختلفی برای انتخاب بهترین جواب استفاده میکنند. اما این رویکرد میتواند به افزایش هزینههای محاسباتی منجر شود. این هزینهها در موارد تحقیقاتی که مقصد به حداکثر رساندن دقت است، مشکلآور نیست.
پیشنهاد مطالعه: معارفه ۵۰ مدل محبوب NFC دار سامسونگ_دریای تکنولوژی
محققان میگویند باید بین ارزیابی مدلها با اهداف تحقیقاتی و مدلهای کاربردی عمومی تفاوت قایل شد. در تحقیقات، دقت اهمیت دارد و هزینههای هوش مصنوعی تا حد بسیاری نادیده گرفته میشود. با این حال، زمان گسترش برنامههای کاربردی در دنیای واقعی، هزینهها نقش مهمی در شیوه جوابدهی مدل هوش مصنوعی ایفا میکند.
برای مثال، محققان یک مطالعهٔ موردی روی بنچمارک NovelQA انجام دادند. آنها دریافتند که این معیار در ارزیابی مدلهای کاربردی عمومی گمراهکننده است.
پیشنهاد مطالعه: открытие دو مدل جدید حفاظت از امنیت آنلاین توسط OpenAI
از سوی دیگر، در یادگیری تسکهای تازه، مدلهای یادگیری ماشینی بینبرهایی اشکار میکنند که به آنها اجازه میدهد در بنچمارکها امتیاز خوبی کسب کنند. اما این مدلها راههایی برای تقلب در آزمونهای بنچمارک پیدا میکنند و نتایجی ارایه میدهند که در دنیای واقعی صحیح نیست.