بنچمارک و هوش مصنوعی

محققان دانشگاه پرینستون در پژوهشی جدید نشان داده‌اند که بنچمارک‌ها در ارزیابی هوش مصنوعی گمراه‌کننده می‌توانند باشند. این تحقیقات با هدف در نظر نداشتن هزینه‌ها در مدل‌های هوش مصنوعی انجام شده و نشان داده‌اند که این روش‌ها برای برنامه‌های کاربردی در دنیای واقعی مفید نیستند.

بر اساس گزارش‌های اخیر، سنجش مدل‌های مختلف هوش مصنوعی با بنچمارک‌های ثابت نمی‌تواند نتایج صحیح در دنیای واقعی ارایه دهد. یکی از مسائل مهمی که محققان بر آن پافشاری می‌کنند، عدم در نظر گرفتن شیوه کنترل هزینه در مدل‌های هوش مصنوعی است.

بنچمارک‌های گمراه‌کننده در ارزیابی هوش مصنوعی

برای افزایش دقت، برخی از سیستم‌های هوش مصنوعی چندین جواب تشکیل می‌دهند و از مکانیسم‌های مختلفی برای انتخاب بهترین جواب استفاده می‌کنند. اما این رویکرد می‌تواند به افزایش هزینه‌های محاسباتی منجر شود. این هزینه‌ها در موارد تحقیقاتی که مقصد به حداکثر رساندن دقت است، مشکل‌آور نیست.

محققان می‌گویند باید بین ارزیابی مدل‌ها با اهداف تحقیقاتی و مدل‌های کاربردی عمومی تفاوت قایل شد. در تحقیقات، دقت اهمیت دارد و هزینه‌های هوش مصنوعی تا حد بسیاری نادیده گرفته می‌شود. با این حال، زمان گسترش برنامه‌های کاربردی در دنیای واقعی، هزینه‌ها نقش مهمی در شیوه جواب‌دهی مدل هوش مصنوعی ایفا می‌کند.

برای مثال، محققان یک مطالعهٔ موردی روی بنچمارک NovelQA انجام دادند. آنها دریافتند که این معیار در ارزیابی مدل‌های کاربردی عمومی گمراه‌کننده است.

از سوی دیگر، در یادگیری تسک‌های تازه، مدل‌های یادگیری ماشینی بینبرهایی اشکار می‌کنند که به آن‌ها اجازه می‌دهد در بنچمارک‌ها امتیاز خوبی کسب کنند. اما این مدل‌ها راه‌هایی برای تقلب در آزمون‌های بنچمارک پیدا می‌کنند و نتایجی ارایه می‌دهند که در دنیای واقعی صحیح نیست.