فرضیه، معیار اصلی و قاعده تصمیم باید پیش از شروع آزمایش روشن باشند. یک چارچوب ساده برای تست محصول.

یک قابلیت را برای بخشی از کاربران فعال میکنیم و چند روز بعد دنبال عددی میگردیم که بهتر شده باشد. این مسیر وسوسهکننده است، اما احتمال دارد نتیجه را مطابق انتظار خودمان انتخاب کنیم. طراحی آزمایش بهتر است قبل از شروع تغییر انجام شود.
فرضیهای که بتواند اشتباه باشد
مثلاً در یک فروشگاه فرضی: «کوتاه کردن فرم پرداخت، احتمال خرید موفق به ازای کاربر واجد شرایط را افزایش میدهد.» حالا تغییر، جامعه هدف و نتیجه مورد انتظار مشخصاند. جملهای مثل «نسخه جدید بهتر است» برای طراحی آزمایش کافی نیست. باید بتوانیم بگوییم کدام مشاهده فرض ما را پشتیبانی نمیکند.
واحد تخصیص و واحد تحلیل
قرار است کاربران را تقسیم کنیم یا نشستها را؟ اگر یک نفر در دو نشست دو نسخه متفاوت ببیند، تجربه و تحلیل پیچیدهتر میشود. برای تغییری که بر تجربه فرد اثر میگذارد، تخصیص پایدار در سطح کاربر معمولاً نقطه شروع مناسبی است. در محصولهایی با تعامل کاربران، اثر یک گروه ممکن است به گروه دیگر برسد؛ آنوقت استقلال گروهها را نباید بدیهی فرض کنیم.
یک معیار اصلی و چند معیار محافظ
معیار اصلی باید به فرضیه نزدیک باشد. برای مثال، تعداد خرید موفق به ازای کاربر تخصیصیافته، با درآمد هر خریدار فرق دارد. اگر فقط کسانی را تحلیل کنیم که بعد از تغییر خریدار شدهاند، گروهها را بر اساس پیامد آزمایش انتخاب کردهایم. در کنار معیار اصلی، خطا، شکایت یا لغو را هم پایش کنیم تا بهبود یک عدد با آسیب مهم دیگری همراه نشود.
حجم نمونه و زمان تصمیم
مدت آزمایش فقط با تعداد روزها تعیین نمیشود؛ تغییر قابل تشخیص، پراکندگی داده و حجم کاربران هم اهمیت دارند. بهتر است پیشاپیش درباره برنامه تحلیل و قاعده توقف تصمیم بگیریم. نگاه مکرر به نتیجه و توقف در اولین لحظه مطلوب، بدون روش آماری مناسب، اعتبار نتیجه را کم میکند. نامطمئن بودن نتیجه با بیاثر بودن تغییر یکسان نیست.
اول مطمئن شویم آزمایش درست اجرا شده
قبل از تفسیر اثر، نسبت کاربران تخصیصیافته، ثبت رویدادها و پایدار بودن نسخهها را بررسی کنیم. اختلاف عجیب در اندازه گروهها میتواند نشانه خطای اجرا باشد. در پایان هم اندازه اثر و عدم قطعیت را کنار هم ببینیم. هدف تست پیدا کردن یک علامت مثبت نیست؛ کم کردن ابهام برای یک تصمیم مشخص است.
