برای نادیده گرفتن محتوا دکمه "Enter" را فشار دهید

مدل هوش مصنوعی خوب برای من کدام است؟ با کار واقعی امتحانش کنیم

رتبه یک مدل در آزمون عمومی، پاسخ کامل برای انتخاب ابزار نیست. یک مجموعه کوچک از کارهای واقعی بسازیم و کیفیت، زمان و هزینه را کنار هم ببینیم.

دو مدل هوش مصنوعی را با یک سؤال کوتاه امتحان می‌کنیم و از پاسخ یکی بیشتر خوشمان می‌آید. برای انتخاب اولیه بد نیست، اما شاید کاری که فردا داریم ترجمه یک متن تخصصی، اصلاح کوئری یا بازنویسی یک پیام باشد. «بهترین مدل» بدون گفتن نوع کار، معیار روشنی ندارد.

از کارهایی که واقعاً انجام می‌دهیم نمونه برداریم

یک مجموعه کوچک، مثلاً ۱۵ تا ۲۰ کار، می‌تواند نقطه شروع باشد: ترجمه، خلاصه‌سازی، نوشتن متن و چند مسئله کدنویسی. این تعداد یک پیشنهاد عملی است، نه حد آماری قطعی. نمونه‌ها باید از نظر طول و دشواری متنوع باشند و از مسئله‌های خیلی ساده تشکیل نشوند. اطلاعات محرمانه را حذف کنیم و برای داده یا متن حساس، نمونه ساختگی بسازیم.

قبل از جواب، معیار را بنویسیم

برای ترجمه، حفظ معنا، اصطلاح‌های تخصصی و روانی فارسی مهم است. برای کد، اجرای درست، حل مسئله خواسته‌شده و رعایت حالت‌های مرزی. برای خلاصه، حفظ نکات مهم و اضافه نکردن ادعای تازه. اگر فقط «خوشم آمد» را امتیاز بدهیم، ممکن است لحن زیبا از دقت جلو بزند. معیارها باید به نتیجه‌ای که از ابزار می‌خواهیم وصل باشند.

مقایسه تا جای ممکن منصفانه باشد

به هر مدل اطلاعات، دستور و فرصت مشابه بدهیم. اگر به یکی چند بار بازخورد بدهیم و از دیگری فقط پاسخ اول را بخواهیم، نتیجه درباره دو فرایند متفاوت است. نام مدل‌ها را هنگام امتیاز دادن پنهان کنیم تا شهرتشان روی قضاوت اثر کمتری داشته باشد. نسخه، تنظیمات، استفاده از ابزار و امکان جست‌وجو را هم ثبت کنیم؛ اختلاف ممکن است از همین شرایط آمده باشد.

زمان اصلاح را هم اندازه بگیریم

مدلی که در چند ثانیه جواب می‌دهد ولی ده دقیقه اصلاح می‌خواهد، شاید از مدل کندترِ دقیق‌تر کم‌فایده‌تر باشد. زمان کل از شروع درخواست تا خروجی قابل استفاده را بسنجیم. در کنار آن، هزینه، محدودیت دستگاه و نیاز به اینترنت را ثبت کنیم. این‌ها جزئی از کیفیت کاربردی ابزارند، حتی اگر در یک جدول رتبه‌بندی عمومی دیده نشوند.

خطای مهم را در میانگین پنهان نکنیم

ممکن است یک مدل در بیشتر نمونه‌ها خوب باشد، اما در یک مورد حساس منبع بسازد یا شرط اصلی کد را حذف کند. بعضی خطاها باید جداگانه گزارش شوند. برای کد، آزمون‌هایی با جواب معلوم مفیدند؛ برای ترجمه و متن، بازبینی انسانی همچنان لازم است. یک نمره خوب در این مجموعه محدود، تضمین درست بودن پاسخ‌های بعدی نیست.

یک مجموعه برای انتخاب، یک مجموعه برای بررسی دوباره

اگر بارها دستور را روی همان نمونه‌ها تنظیم کنیم، ارزیابی به همان کارها وابسته می‌شود. چند نمونه تازه را کنار بگذاریم تا پس از انتخاب، دوباره ابزار را بررسی کنیم. با تغییر نسخه یا نوع کار هم ارزیابی را به‌روز کنیم. شاید در نهایت برای ترجمه یک ابزار و برای کد ابزار دیگری انتخاب کنیم؛ نتیجه باید به کار واقعی کمک کند، نه فقط یک برنده همیشگی معرفی کند.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *