رتبه یک مدل در آزمون عمومی، پاسخ کامل برای انتخاب ابزار نیست. یک مجموعه کوچک از کارهای واقعی بسازیم و کیفیت، زمان و هزینه را کنار هم ببینیم.

دو مدل هوش مصنوعی را با یک سؤال کوتاه امتحان میکنیم و از پاسخ یکی بیشتر خوشمان میآید. برای انتخاب اولیه بد نیست، اما شاید کاری که فردا داریم ترجمه یک متن تخصصی، اصلاح کوئری یا بازنویسی یک پیام باشد. «بهترین مدل» بدون گفتن نوع کار، معیار روشنی ندارد.
از کارهایی که واقعاً انجام میدهیم نمونه برداریم
یک مجموعه کوچک، مثلاً ۱۵ تا ۲۰ کار، میتواند نقطه شروع باشد: ترجمه، خلاصهسازی، نوشتن متن و چند مسئله کدنویسی. این تعداد یک پیشنهاد عملی است، نه حد آماری قطعی. نمونهها باید از نظر طول و دشواری متنوع باشند و از مسئلههای خیلی ساده تشکیل نشوند. اطلاعات محرمانه را حذف کنیم و برای داده یا متن حساس، نمونه ساختگی بسازیم.
قبل از جواب، معیار را بنویسیم
برای ترجمه، حفظ معنا، اصطلاحهای تخصصی و روانی فارسی مهم است. برای کد، اجرای درست، حل مسئله خواستهشده و رعایت حالتهای مرزی. برای خلاصه، حفظ نکات مهم و اضافه نکردن ادعای تازه. اگر فقط «خوشم آمد» را امتیاز بدهیم، ممکن است لحن زیبا از دقت جلو بزند. معیارها باید به نتیجهای که از ابزار میخواهیم وصل باشند.
مقایسه تا جای ممکن منصفانه باشد
به هر مدل اطلاعات، دستور و فرصت مشابه بدهیم. اگر به یکی چند بار بازخورد بدهیم و از دیگری فقط پاسخ اول را بخواهیم، نتیجه درباره دو فرایند متفاوت است. نام مدلها را هنگام امتیاز دادن پنهان کنیم تا شهرتشان روی قضاوت اثر کمتری داشته باشد. نسخه، تنظیمات، استفاده از ابزار و امکان جستوجو را هم ثبت کنیم؛ اختلاف ممکن است از همین شرایط آمده باشد.
زمان اصلاح را هم اندازه بگیریم
مدلی که در چند ثانیه جواب میدهد ولی ده دقیقه اصلاح میخواهد، شاید از مدل کندترِ دقیقتر کمفایدهتر باشد. زمان کل از شروع درخواست تا خروجی قابل استفاده را بسنجیم. در کنار آن، هزینه، محدودیت دستگاه و نیاز به اینترنت را ثبت کنیم. اینها جزئی از کیفیت کاربردی ابزارند، حتی اگر در یک جدول رتبهبندی عمومی دیده نشوند.
خطای مهم را در میانگین پنهان نکنیم
ممکن است یک مدل در بیشتر نمونهها خوب باشد، اما در یک مورد حساس منبع بسازد یا شرط اصلی کد را حذف کند. بعضی خطاها باید جداگانه گزارش شوند. برای کد، آزمونهایی با جواب معلوم مفیدند؛ برای ترجمه و متن، بازبینی انسانی همچنان لازم است. یک نمره خوب در این مجموعه محدود، تضمین درست بودن پاسخهای بعدی نیست.
یک مجموعه برای انتخاب، یک مجموعه برای بررسی دوباره
اگر بارها دستور را روی همان نمونهها تنظیم کنیم، ارزیابی به همان کارها وابسته میشود. چند نمونه تازه را کنار بگذاریم تا پس از انتخاب، دوباره ابزار را بررسی کنیم. با تغییر نسخه یا نوع کار هم ارزیابی را بهروز کنیم. شاید در نهایت برای ترجمه یک ابزار و برای کد ابزار دیگری انتخاب کنیم؛ نتیجه باید به کار واقعی کمک کند، نه فقط یک برنده همیشگی معرفی کند.
