در تست A/A هر دو گروه یک تجربه دارند. اختلافها کمک میکنند مسیر تخصیص و اندازهگیری را بررسی کنیم؛ هدف پیدا کردن دو گروه کاملاً برابر نیست.

در تست A/B میخواهیم اثر یک تغییر را بسنجیم. اما اگر تخصیص کاربران، ثبت رویدادها یا محاسبه شاخصها مشکل داشته باشد، اختلاف دو گروه ممکن است از خود آزمایش نیامده باشد. تست A/A فرصتی است که قبل از تغییر تجربه، بخشی از این مسیر را بررسی کنیم.
دو گروه، یک تجربه
کاربران را با سازوکار آزمایش به دو گروه تقسیم میکنیم، ولی تجربه محصول در هر دو یکسان است. انتظار نداریم اندازهگیریها دقیقاً برابر شوند؛ تصادفی بودن تخصیص و رفتار متغیر کاربران اختلاف میسازد. انتظار این است که الگوی اختلافها با فرضهای روش آماری و کیفیت اجرای آزمایش سازگار باشد.
اول مسیر فنی را بررسی کنیم
آیا نسبت تخصیص با نسبت طراحیشده هماهنگ است؟ کاربر هنگام بازگشت در همان گروه میماند؟ هر دو گروه از یک مسیر ثبت رویداد و محاسبه شاخص استفاده میکنند؟ داده دیررس یا حذفشده برای یک گروه بیشتر نیست؟ این سؤالها از صرفاً نگاه کردن به یک مقدار p مهمترند. اختلاف غیرمنتظره باید به بررسی علت برسد، نه فقط عوض کردن تقسیمبندی.
یک نتیجه معنادار الزاماً نشانه خرابی نیست
اگر آزمونی با سطح خطای نوع اول ۵ درصد درست کالیبره شده باشد، در تکرارهای متعدد زیر فرض نبود اثر، حدود ۵ درصد نتایج میتوانند به اشتباه معنادار شوند. این حرف درباره عملکرد روش در تکرار است؛ به معنی احتمال ۵ درصدِ غلط بودن یک نتیجه مشخص نیست. بنابراین از یک نتیجه منفرد نباید فوری حکم بدهیم که ابزار خراب است یا قطعاً سالم است.
تعداد مقایسهها را فراموش نکنیم
اگر دهها شاخص، چند بازه زمانی و چند تقسیمبندی را امتحان کنیم، فرصت دیدن اختلاف تصادفی بیشتر میشود. گزارش فقط یک نتیجه مطلوب، تصویر کامل بررسی را نشان نمیدهد. معیارها و برنامه تحلیل را از قبل مشخص کنیم و برای مقایسههای متعدد از روش متناسب استفاده کنیم. نبود اختلاف معنادار هم ثابت نمیکند دو گروه از هر نظر برابرند.
تقسیمبندی را با گذشته زیبا نکنیم
امتحان کردن تعداد زیادی seed یا مد و انتخاب موردی که روی همان داده تاریخی کمترین اختلاف را دارد، تضمین تعادل آینده نیست. آن انتخاب به دادهای که دیدهایم وابسته شده و تفسیر آماری بعدی باید این فرایند را در نظر بگیرد. بهتر است سازوکار تخصیص را با دلیل روشن و مستقل انتخاب کنیم؛ اگر از داده پیش از آزمایش برای بهبود دقت استفاده میکنیم، روشش را صریح و از پیش مشخص نگه داریم.
خروجی تست، فهرست بررسی است
یک تست A/A خوب باید نتیجهای قابل توضیح درباره تخصیص، پوشش داده و رفتار روش تحلیل بدهد. بعد از اصلاح یک خطای واقعی، دوباره همان بخش را بررسی کنیم. هدف، پیدا کردن دو ستون کاملاً مشابه نیست؛ میخواهیم بدانیم وقتی تغییری نداریم، سیستم اندازهگیری چه رفتاری نشان میدهد و چقدر میتوانیم به آزمایش بعدی اعتماد کنیم.
