ข้ามไปเนื้อหาหลัก

A/B Testing ผล​วัน​แรก​เชื่อ​ได้​แค่​ไหน บท​เรียน​จาก Microsoft

อัปเดตล่าสุด 27 กันยายน 2569
เวลาอ่านประมาณ 11 นาที
A/B Testing ผล​วัน​แรก​เชื่อ​ได้​แค่​ไหน บท​เรียน​จาก Microsoft

KEY TAKEAWAYS

3 ประเด็น

งาน​วิจัย​ของ​ทีม​ทดลอง​ออนไลน์ Microsoft ที่​ตี​พิมพ์​ใน KDD 2012 พบ​ว่า​ผล​ของ​วัน​แรก​มี​โอกาส 67% ที่​จะ​อยู่​นอก​ขอบ​ความ​เชื่อ​มั่น 95% ของ​ผล​ตอน​จบ​การ​ทดลอง

ส่วน​ผล​ของ​วัน​ที่​สอง​มี​โอกาส 55% การ​หยุด​ทดสอบ​เพราะ​เห็น​แนว​โน้ม​ใน​ไม่​กี่​วัน​แรก​จึง​เสี่ยง​สรุป​ผิด

ตัว​ชี้​วัด​ที่​ดี​ขึ้น​อาจ​มา​จาก​ประสบการณ์​ที่​แย่​ลง

การ​ทดลอง​ของ Bing ที่​มี​บั๊ก​ทำให้​ผล​ค้นหา​แย่​ลง กลับ​ทำให้​จำนวน​คำ​ค้น​ต่อ​ผู้​ใช้​เพิ่ม​กว่า 10% และ​ราย​ได้​ต่อ​ผู้​ใช้​เพิ่ม​กว่า 30% ใน​ระยะ​สั้น

ผู้​เขียน​แนะนำ​ให้​รัน A/A test อย่าง​ต่อ​เนื่อง

คือ​แบ่ง​ผู้​ใช้​สอง​กลุ่ม​ที่​เห็น​หน้า​เดียวกัน ถ้า​ระบบ​ถูก​ต้อง ผล​ต่าง​ที่​มี​นัย​สำคัญ​ควร​เกิด​ราว 5% ของ​เวลา​ที่​ระดับ​ความ​เชื่อ​มั่น 95%

งาน​วิจัย Microsoft KDD 2012 พบ​ผล​วัน​แรก​ของ A/B test มี​โอกาส 67% ไม่​ตรง​ผล​ตอน​จบ ตัว​ชี้​วัด​หลัก การ​วัด​คลิก A/A test และ​ผล​ค้าง​ที่​ต้อง​ตรวจ โดย PHYGITAL AGENCY

ทีม​ที่​เปิด​ดู​ผล​การ​ทดสอบ A/B ทุก​เช้า​อยู่​ภาย​ใต้​แรง​กดดัน​ให้​ตัดสิน​เร็ว ถ้า​หน้า​ใหม่​นำ​อยู่​สาม​วัน​ติด​กัน​ก็​อยาก​ประกาศ​ผู้​ชนะ ถ้า​ตาม​หลัง​ก็​อยาก​หยุด​เพื่อ​ไม่​ให้​เสีย​ยอด​ขาย ปัญหา​คือ​ตัวเลข​ช่วง​แรก​ของ​การ​ทดสอบ​ออนไลน์​แกว่ง​มากกว่า​ที่​คน​ดู​คาด และ​ตัว​ชี้​วัด​ที่​ดี​ขึ้น​ก็​ไม่​ได้​แปล​ว่า​ผู้​ใช้ได้​ประสบการณ์​ที่​ดี​ขึ้น​เสมอ บท​นี้​สรุป​บท​เรียน​ห้า​ข้อ​จาก​งาน​วิจัย​ของ​ทีม​ที่​รัน​การ​ทดสอบ​ออนไลน์​หลาย​พัน​ครั้ง เพื่อ​ให้​เจ้าของ​ธุรกิจ​และ​ทีม​การ​ตลาด​รู้​ว่า​ต้อง​ดู​อะไร​ก่อน​เชื่อ​ผล​การ​ทดสอบ​ของ​ตัว​เอง

เนื้อหา​ทั้งหมด​มา​จาก​บทความ​วิจัย Trustworthy Online Controlled Experiments: Five Puzzling Outcomes Explained โดย Ron Kohavi และ​คณะ​จาก Microsoft นำ​เสนอ​ใน​งาน​ประชุม KDD 2012 เปิด​อ่าน​ฉบับ​เต็ม​เมื่อ 27 ก.ย. 2569 กรณี​ตัวอย่าง​ทั้งหมด​เป็นการ​ทดลอง​ของ Bing และ​บริการ​อื่น​ของ Microsoft ซึ่ง​มี​ผู้​ใช้​มากกว่า​เว็บไซต์​ของ​ธุรกิจ​ทั่วไป​มาก บท​นี้​จึง​นำ​มา​ใช้​เป็น​หลัก​คิด ไม่​ได้​อ้าง​ว่า​ตัวเลข​จะ​เกิด​ซ้ำ​ใน​เว็บไซต์​ขนาด​เล็ก

ฉบับ​เดิม​ของ​หน้า​นี้​อธิบาย​ขั้น​ตอน​ทำ A/B test แบบ​ทั่วไป ฉบับ​นี้​เลือก​มุม​ที่​ขั้น​ตอน​ทั่วไป​ไม่​ได้​พูด คือ​การ​ทดสอบ​ที่​ทำ​ถูก​ขั้น​ตอน​แล้ว​ยัง​ให้​ผล​ที่​ทำให้​สรุป​ผิด​ได้​อย่างไร

งาน​วิจัย​นี้​มา​จาก​ไหน

ผู้​เขียน​เป็น​ทีม​ที่​สร้าง​แพลตฟอร์ม​การ​ทดลอง​ของ Microsoft บทความ​ระบุ​ว่า​ทีม​รัน​การ​ทดลอง​ควบคุม​ออนไลน์​มา​แล้ว​หลาย​พัน​ครั้ง และ​เลือก​ผล​ห้า​กรณี​ที่​ต้อง​ใช้​เวลา​วิเคราะห์​หลาย​สัปดาห์​ถึง​หลาย​เดือน​กว่า​จะ​เข้าใจ​สาเหตุ ผู้​เขียน​ระบุ​ว่า​สาเหตุ​เหล่า​นี้​ไม่ใช่​เหตุการณ์​เฉพาะ​ครั้ง แต่​เกิด​ซ้ำ​ใน​การ​ทดลอง​อื่น​ด้วย

บทความ​ยัง​ยก​สถิติ​ที่​อธิบาย​ว่า​ทำไม​การ​ทดสอบ​ต้อง​เชื่อ​ถือ​ได้ ผู้​เขียน​เคย​รายงาน​ว่า​ไอ​เดีย​ที่​ทดสอบ​ที่ Microsoft มี​เพียง​ราว​หนึ่ง​ใน​สาม​ที่​ทำให้​ตัว​ชี้​วัด​ดี​ขึ้น​ตาม​ที่​ออกแบบ​ไว้ และ​ยก​คำ​พูด​จาก​แหล่ง​อื่น​ว่า Google รัน​การ​ทดลอง​ราว 12,000 ครั้ง​ใน​ปี 2009 และ​มี​ราว 10% ที่​นำ​ไป​สู่​การ​เปลี่ยนแปลง​ทาง​ธุรกิจ เมื่อ​ไอ​เดีย​ส่วน​ใหญ่​ไม่​ได้​ผล ผล​การ​ทดสอบ​ที่​ผิด​จะ​ทำให้​ไอ​เดีย​ที่​ไม่​ดี​ถูก​นำ​ไป​ใช้ หรือ​ไอ​เดีย​ที่​ดี​ถูก​ทิ้ง

A/B test กับ​การ​ทดลอง​ควบคุม​ต่าง​กัน​อย่างไร

บทความ​ใช้​คำ​ว่าการ​ทดลอง​ควบคุม​ออนไลน์ (online controlled experiment) ซึ่ง​ครอบคลุม A/B test ผู้​ใช้​ถูก​สุ่ม​แบ่ง​เป็นก​ลุ่ม​ควบคุม​ที่​เห็น​แบบ​เดิม และ​กลุ่ม​ทดลอง​ที่​เห็น​แบบ​ใหม่ แล้ว​เทียบ​ตัว​ชี้​วัด​ของ​สอง​กลุ่ม​ด้วย​การ​ทดสอบ​ทาง​สถิติ หลัก​การ​นี้​ย้อน​กลับ​ไป​ถึง​การ​ทดลอง​ทางการ​เกษตร​ของ Ronald Fisher ใน​ทศวรรษ 1920

ตัว​ชี้​วัด​หลัก​ที่​เลือก​ผิด​ทำให้​ผล​ที่​แย่​ดู​ดี

บทความ​เรียก​ตัว​ชี้​วัด​หลัก​ที่​ใช้​ตัดสิน​ว่า Overall Evaluation Criterion หรือ OEC กรณี​แรก​เป็นการ​ทดลอง​ของ Bing ที่​มี​บั๊ก​ทำให้​ผล​ค้นหา​แย่​มาก แต่​ตัว​ชี้​วัด​สำคัญ​สอง​ตัว​กลับ​ดี​ขึ้น​อย่าง​มี​นัย​สำคัญ จำนวน​คำ​ค้น​ต่อ​ผู้​ใช้​เพิ่ม​กว่า 10% และ​ราย​ได้​ต่อ​ผู้​ใช้​เพิ่ม​กว่า 30%

ผู้​เขียน​อธิบาย​ว่า​ผล​ค้นหา​ที่​แย่​บังคับ​ให้​ผู้​ใช้​ค้น​ซ้ำ​หลาย​ครั้ง และ​คลิก​โฆษณา​มาก​ขึ้น​เพราะ​โฆษณา​ดู​ตรง​กว่า​ผล​ค้นหา ผู้​เขียน​เปรียบ​กับ​การ​ขึ้น​ราคา​ใน​ร้าน​ค้า​ปลีก ราย​ได้​ระยะ​สั้น​เพิ่ม แต่​ลูกค้า​จะ​หัน​ไป​หา​คู่​แข่ง​ใน​ระยะ​ยาว

บท​เรียน​สำหรับ​ธุรกิจ​ทั่วไป

  1. ตัว​ชี้​วัด​หลัก​ต้อง​ผูก​กับ​เป้า​หมาย​ระยะ​ยาว ผู้​เขียน​แนะนำ​ให้​คิดถึง​มูลค่า​ตลอด​อายุ​ของ​ลูกค้า ไม่ใช่​ราย​ได้​ต่อ​ผู้​ใช้​ใน​สัปดาห์​เดียว
  2. ตัว​ชี้​วัด​บาง​ตัว​ควร​เพิ่ม บาง​ตัว​ควร​ลด ใน​กรณี​ของ Bing ผู้​เขียน​แยก​ว่า​จำนวน​เซสชัน​ต่อ​ผู้​ใช้​ควร​เพิ่ม ส่วน​จำนวน​คำ​ค้น​ต่อ​เซสชัน​ควร​ลด​ลง​เมื่อ​ผู้​ใช้​หา​คำ​ตอบ​เจอ​เร็ว
  3. ราย​ได้​ไม่​ควร​เป็น​ตัว​ชี้​วัด​เดียว ผู้​เขียน​ระบุ​ว่า​ราย​ได้​ต่อ​ผู้​ใช้​ไม่​ควร​ใช้​เป็น​ตัว​ตัดสิน​โดย​ไม่มี​เงื่อนไข​อื่น​กำกับ

ร้าน​ออนไลน์​ควร​ใช้​อะไร​เป็น​ตัว​ชี้​วัด​หลัก

ตัว​ชี้​วัด​ที่​ร้าน​เลือก​ควร​บอก​ว่า​ผู้​ซื้อ​ทำ​สิ่ง​ที่​ตั้งใจ​ได้​สำเร็จ เช่น​สัดส่วน​ผู้​เข้า​ชม​ที่​ซื้อ​สำเร็จ คู่​กับ​ตัว​ชี้​วัด​กัน​พลาด เช่น​อัตรา​การ​คืน​สินค้า​หรือ​การ​ติดต่อ​ฝ่าย​บริการ​หลัง​ซื้อ หน้าที่​ทำให้​ยอด​ขาย​วัน​นี้​เพิ่ม​แต่​มี​คน​ขอ​คืน​เงิน​มาก​ขึ้น ไม่​ควร​นับ​เป็น​ผู้​ชนะ ส่วน​สูตร​ของ CTR และ ROAS ที่​แต่ละ​แพลตฟอร์ม​โฆษณา​ใช้ อยู่​ในKPI โฆษณา CTR กับ ROAS ที่ Google และ Meta นับ​ต่าง​กัน

คลิก​ที่​เพิ่ม​ขึ้น​เพราะ​การ​วัด

กรณี​ที่​สอง​เป็นการ​เพิ่ม​โค้ด​ที่​ทำงาน​ตอน​ผู้​ใช้​คลิก​ผล​ค้นหา ทำให้​หน้า​เว็บ​ช้า​ลง​เล็ก​น้อย แต่​ผล​การ​ทดลอง​กลับ​บอก​ว่า​ผู้​ใช้​คลิก​มาก​ขึ้น ผู้​เขียน​พบ​ว่า​ความ​สำเร็จ​นี้​ไม่ใช่​ของ​จริง เบราว์เซอร์​หลาย​ตัว​ตัด​คำขอ​ที่​ยัง​ส่ง​ไม่​เสร็จ​เมื่อ​ผู้​ใช้​ออก​จาก​หน้า ทำให้​สัญญาณ​บันทึก​การ​คลิก​จำนวน​หนึ่ง​ไป​ไม่​ถึง​เซิร์ฟเวอร์ ผู้​เขียน​ระบุ​ว่า​บน Safari บาง​ครั้ง​หาย​เกิน 50% โค้ด​ที่​เพิ่ม​เข้า​มา​ทำให้​หน้า​ช้า​ลง​พอ​ให้​สัญญาณ​ส่ง​ถึง​มาก​ขึ้น จำนวน​คลิก​ที่​บันทึก​ได้​จึง​เพิ่ม ทั้ง​ที่​พฤติกรรม​จริง​ไม่​ได้​เปลี่ยน

ผู้​เขียน​เล่า​อีก​กรณี​หนึ่ง​ที่​การ​เปลี่ยน​ให้​หน้า​อัปเดต​แทน​การ​เปลี่ยน URL ทำให้​การ​ใช้​งาน​ฟีเจอร์​ดู​เพิ่ม​ขึ้น​มาก แต่​จำนวน​การ​ค้นหา​รวม​ไม่​ได้​เพิ่ม​ตาม เพราะ​สิ่ง​ที่​เปลี่ยน​จริง​คือ​การ​บันทึก​คลิก​เชื่อ​ถือ​ได้​มาก​ขึ้น

ทีม​การ​ตลาด​ตรวจ​เรื่อง​นี้​เอง​ได้​อย่างไร

ถ้า​หน้า​ทดลอง​ต่าง​จาก​หน้า​เดิม​ใน​วิธี​ที่​ระบบ​วัดผล​ทำงาน เช่น​เปลี่ยน​การ​โหลด​หน้า เปลี่ยน​แท็ก​ติดตาม หรือ​เปลี่ยน​จาก​ลิงก์​เป็นการ​อัปเดต​ใน​หน้า​เดียว ให้​เทียบ​ตัวเลข​จาก​สอง​แหล่ง​ที่​ไม่​ขึ้น​กับ​กัน เช่น​จำนวน​คลิก​ใน​เครื่อง​มือ​วิเคราะห์​เว็บ​กับ​จำนวน​คำ​สั่ง​ซื้อ​ใน​ระบบ​หลัง​ร้าน ถ้า​คลิก​เพิ่ม​แต่​คำ​สั่ง​ซื้อ​ไม่​เพิ่ม​ตาม ให้​สงสัย​การ​วัด​ก่อน​เชื่อ​ผล

แนว​โน้ม​ของ​วัน​แรก ๆ

กรณี​ที่​สาม​เกิด​บ่อย​ที่สุด เจ้าของ​ฟีเจอร์​เห็น​ผล​สะสม​ของ​ไม่​กี่​วัน​แรก​ขยับ​ขึ้น​หรือ​ลง​เป็น​เส้น​ตรง แล้ว​คาด​ว่า​แนว​โน้ม​จะ​ดำเนิน​ต่อ ผู้​เขียน​แสดง​กราฟ​ผล​สะสม​ที่​วัน​แรก​ติดลบ​แล้ว​ค่อย ๆ ขยับ​เข้าหา​ศูนย์ และ​เฉลย​ว่า​กราฟ​นั้น​มา​จาก A/A test ที่​สอง​กลุ่ม​เห็น​หน้า​เดียวกัน จึง​ไม่มี​ความ​ต่าง​จริง​เลย

คำ​อธิบาย​คือ​ความ​แปรปรวน​ของ​ค่า​เฉลี่ย​ลด​ลง​ตาม​จำนวน​ผู้​ใช้​ที่​เพิ่ม​ขึ้น วัน​แรก ๆ มี​ผู้​ใช้​น้อย ผล​จึง​แกว่ง​มาก ผู้​เขียน​คำนวณ​ว่า​ผล​ของ​วัน​แรก​มี​โอกาส 67% ที่​จะ​อยู่​นอก​ขอบ​ความ​เชื่อ​มั่น 95% ของ​ผล​ตอน​จบ​การ​ทดลอง และ​วัน​ที่​สอง​มี​โอกาส 55% เมื่อ​ผล​สะสม​ค่อย ๆ เข้า​ใกล้​ค่า​จริง กราฟ​จึง​ดู​เหมือน​มี​แนว​โน้ม​ทั้ง​ที่​ไม่มี

ผู้​เขียน​แยก​ผล​สอง​แบบ​ที่​อาจ​เกิด​จริง​เมื่อ​มี​ของ​ใหม่ คือ Primacy effect ที่​ผู้​ใช้​เดิม​ยัง​ไม่​ชิน​กับ​หน้า​ใหม่ และ Novelty effect ที่​ผู้​ใช้​ลอง​กด​ของ​ใหม่​เพราะ​ความ​แปลก​ใหม่ แต่​ระบุ​ว่าการ​ทดลอง​ของ​ทีม​แทบ​ไม่​เคย​มี​กรณี​ที่​ผลก​ลับ​ทิศ​จน​มี​นัย​สำคัญ​ใน​ทาง​ตรง​ข้าม​เพราะ​สอง​ผล​นี้

ถ้า​สงสัย​ว่า​ผล​เกิด​จาก​ความ​แปลก​ใหม่ ควร​ทำ​อย่างไร

ผู้​เขียน​เสนอ​ให้​ดู​กราฟ​ผล​ต่าง​ระหว่าง​สอง​กลุ่ม​ตาม​เวลา ถ้า​สงสัย​ว่า​มี​แนว​โน้ม​จริง​ให้​ขยาย​เวลา​ทดลอง และ​วิเคราะห์​เฉพาะ​ผู้​ใช้​ใหม่​ใน​แต่ละ​กลุ่ม เพราะ​ผู้​ใช้​ใหม่​ไม่​ได้​รับ​ผล​จาก​ความ​เคยชิน​หรือ​ความ​แปลก​ใหม่

ทดสอบ​นาน​ขึ้น​ไม่​ได้​แม่น​ขึ้น​เสมอ

กรณี​ที่​สี่​ขัด​กับ​ความ​เข้าใจ​ทั่วไป สำหรับ​ตัว​ชี้​วัด​บาง​ตัว เช่น​จำนวน​เซสชัน​ต่อ​ผู้​ใช้ ช่วง​ความ​เชื่อ​มั่น​ของ​ผล​ต่าง​เป็น​เปอร์เซ็นต์​แทบ​ไม่​แคบ​ลง​เมื่อ​ทดลอง​นาน​ขึ้น เพราะ​ส่วน​เบี่ยง​เบน​มาตรฐาน​เพิ่ม​เร็ว​กว่า​ค่า​เฉลี่ย สัมประสิทธิ์​การ​แปรผัน​จึง​เพิ่ม​ตาม​เวลา ส่วน​ตัว​ชี้​วัด​ที่​มี​ขอบเขต เช่น​อัตรา​การ​คลิก ช่วง​ความ​เชื่อ​มั่น​แคบ​ลง​ตาม​เวลา​ได้​ตาม​ปกติ

ผู้​เขียน​ตอบ​คำถาม​ว่า​ถ้า​ทดลอง​นาน​ขึ้น​ไม่​ช่วย ทำไม​ยัง​ต้อง​ทดลอง​เกิน​หนึ่ง​สัปดาห์ ทีม​ถือว่า​หนึ่ง​สัปดาห์​เป็น​ขั้น​ต่ำ​เพื่อ​ดู​ความ​ต่าง​ของ​แต่ละ​วัน​ใน​สัปดาห์ และ​เหตุผล​หลัก​ของ​การ​ทดลอง​นาน​กว่า​นั้น​คือ​ผล​อาจ​มา​ช้า​จาก Primacy และ Novelty effect ส่วน​การ​เพิ่ม​ความ​แม่นยำ​ควร​ทำ​ด้วย​การ​เพิ่ม​ผู้​ใช้​ต่อ​วัน​ใน​แต่ละ​กลุ่ม

ผล​ค้าง​จาก​การ​ทดสอบ​รอบ​ก่อน

กรณี​ที่​ห้า​เกิด​กับ​ระบบ​ที่​แบ่ง​ผู้​ใช้​เป็น​ถัง (bucket) แล้ว​นำ​ถัง​เดิม​มา​ใช้​ใน​การ​ทดลอง​รอบ​ถัด​ไป ผู้​ใช้​ที่​ได้​รับ​ผล​จาก​การ​ทดลอง​รอบ​แรก​ถูก​นำ​ไป​ใช้​ใน​รอบ​ต่อ​มา ผล​ของ​รอบ​แรก​จึง​ค้าง​มา​ปน​กับ​ผล​รอบ​ใหม่ ผู้​เขียน​เล่า​ว่า​สิ่ง​ที่​ทำให้​ประหลาด​ใจ​คือ​ระยะ​เวลา​ที่​ผล​ค้าง​อยู่ ตัวอย่าง​หนึ่ง​ผล​ค้าง​หาย​ไป​ราว​สัปดาห์​ที่​สามหลัง​จบ​การ​ทดลอง และ​อีก​ตัวอย่าง​หนึ่ง​ผล​ค้าง​นาน​ราว​สาม​เดือน

ผู้​เขียน​แนะนำ​ให้​ใช้ A/A test ตรวจ​ผล​ค้าง และ​ให้​แพลตฟอร์ม​การ​ทดลอง​สุ่ม​แบ่ง​ผู้​ใช้​ใหม่​เมื่อ​พบ​ปัญหา ร้าน​ที่​ทดสอบ​หน้า​ชำระ​เงิน​หลาย​รอบ​ติด​กัน​บน​ผู้​ใช้​กลุ่ม​เดิม จึง​ควร​เว้น​ช่วง​หรือ​สุ่ม​กลุ่ม​ใหม่​ก่อน​เริ่ม​รอบ​ถัด​ไป ร้าน​ที่​ยัง​ไม่รู้​ว่า​จะ​เริ่ม​ทดสอบ​จุด​ไหน​บน​หน้า​ชำระ​เงิน ดู​รายการ​เหตุผล​ที่​ผู้​ซื้อ​ทิ้ง​ตะกร้า​ในCRO หน้า​ชำระ​เงิน คน​ทิ้ง​ตะกร้า 70% แก้​จุด​ไหน​ได้​ก่อน แล้ว​เลือก​เหตุผล​ที่​ร้าน​แก้​ได้​มา​ตั้ง​เป็น​สมมติฐาน​ของ​การ​ทดสอบ​รอบ​แรก การ​ตั้ง​สมมติฐาน​จาก​เหตุผล​ที่​มี​ข้อมูล​รองรับ ช่วย​ให้​ผล​ที่​ออก​มา​แปล​ความ​ได้​ง่าย​กว่า​การ​ทดสอบ​สิ่ง​ที่​ทีม​นึก​ขึ้น​ได้​ใน​ที่​ประชุม และ​ถ้า​ผลอ​อก​มา​ไม่​ต่าง​กัน ทีม​ก็​ยัง​รู้​ว่า​เหตุผล​ข้อ​นั้น​อาจ​ไม่ใช่​ปัญหา​หลัก​ของ​ร้าน แล้ว​ขยับ​ไป​ทดสอบ​เหตุผล​ข้อ​ถัด​ไป​ใน​รายการ​ได้​ทันที​โดย​ไม่​เสีย​เวลา​เถียง​กัน

ก่อน​ประกาศ​ผู้​ชนะ

ผล​นี้​ผ่าน​การ​ตรวจ​เรื่อง​การ​วัด​แล้ว​หรือ​ยัง

เทียบ​ตัวเลข​จาก​เครื่อง​มือ​ทดสอบ​กับ​ระบบ​หลัง​ร้าน​อย่าง​น้อยห​นึ่ง​แหล่ง ตรวจ​ว่า​กลุ่ม​ทดลอง​กับ​กลุ่ม​ควบคุม​มี​จำนวน​ผู้​ใช้​ใกล้​กัน​ตาม​ที่​ตั้ง​ไว้ และ​ตรวจ​ว่า​หน้า​ทดลอง​ไม่​ได้​เปลี่ยน​วิธี​ที่​แท็ก​ติดตาม​ทำงาน ถ้า​ยัง​ไม่​ได้​ตรวจ ผล​ที่​ดี​ขึ้น​อาจ​มา​จาก​การ​วัด

ผล​ที่​ชนะ​ดี​ขึ้น​ใน​ตัว​ชี้​วัด​ที่​ผูก​กับ​เป้า​หมาย​ระยะ​ยาว​หรือ​ไม่

ดู​ตัว​ชี้​วัด​หลัก​ที่​ตั้ง​ไว้​ก่อน​เริ่ม ไม่ใช่​ตัว​ชี้​วัด​ที่​บังเอิญ​ดี​ขึ้น​หลัง​จบ ถ้า​ราย​ได้​ระยะ​สั้น​เพิ่ม​แต่​ตัว​ชี้​วัด​กัน​พลาด เช่น​การ​คืน​สินค้า​หรือ​การ​ร้อง​เรียน แย่​ลง ให้​ถือว่า​ยัง​ไม่มี​ผู้​ชนะ

สรุป

งาน​วิจัย​ของ​ทีม​ทดลอง​ออนไลน์ Microsoft ใน KDD 2012 สรุป​บท​เรียน​ห้า​ข้อ ตัว​ชี้​วัด​หลัก​ที่​เลือก​ผิด​ทำให้​ประสบการณ์​ที่​แย่​ดู​ดี ดัง​กรณี​บั๊ก​ของ Bing ที่​ทำให้​คำ​ค้น​เพิ่ม​กว่า 10% และ​ราย​ได้​เพิ่ม​กว่า 30% การ​เปลี่ยน​วิธี​วัด​ทำให้​คลิก​ดู​เพิ่ม​ขึ้น ผล​ของ​วัน​แรก​มี​โอกาส 67% ที่​จะ​อยู่​นอก​ขอบ​ความ​เชื่อ​มั่น​ของ​ผล​ตอน​จบ การ​ทดลอง​นาน​ขึ้น​ไม่​ได้​แม่น​ขึ้น​สำหรับ​ตัว​ชี้​วัด​บาง​ตัว และ​ผล​ของ​การ​ทดลอง​รอบ​ก่อน​ค้าง​ได้​นาน​หลาย​สัปดาห์​ถึง​หลาย​เดือน A/A test เป็น​เครื่อง​มือ​ที่​ผู้​เขียน​แนะนำ​ให้​ใช้​ตรวจ​ปัญหา​เหล่า​นี้​อย่าง​ต่อ​เนื่อง

คำถามที่พบบ่อย (FAQ)

ทำได้ แต่​ต้อง​ใช้​เวลา​นาน​กว่า​และ​ทดสอบ​ความ​ต่าง​ที่​ใหญ่​พอ เพราะ​งาน​วิจัย​อธิบาย​ว่า​ความ​แม่นยำ​ขึ้น​กับ​จำนวน​ผู้​ใช้ เว็บไซต์​เล็ก​ที่​ทดสอบ​การ​เปลี่ยนแปลง​เล็ก​น้อย เช่น​สี​ปุ่ม อาจ​ไม่มี​ผู้​ใช้​มาก​พอ​จะ​แยก​ผล​จริง​ออก​จาก​ความ​แกว่ง​ได้

ผู้​เขียน​เรียก A/A test ว่า​เป็น​เครื่อง​มือ​ที่​มี​ประโยชน์​ที่สุด​ใน​การ​หา​ปัญหา​ของ​ระบบ​ทดลอง ธุรกิจ​เล็ก​ที่​ใช้​เครื่อง​มือ​ทดสอบ​สำเร็จรูป ควร​รัน A/A test อย่าง​น้อยห​นึ่ง​ครั้ง​ก่อน​เชื่อ​ผล​รอบ​แรก ถ้า​เครื่อง​มือ​บอก​ว่า​หน้า​เดียวกัน​สอง​หน้าต่าง​กัน​อย่าง​มี​นัย​สำคัญ​บ่อย​กว่า​ที่​ควร แสดง​ว่าการ​แบ่ง​กลุ่ม​หรือ​การ​วัด​มี​ปัญหา และ​ควร​แก้​ให้​เรียบร้อย​ก่อน​เริ่ม​ทดสอบ​ของ​จริง​ทุก​ครั้ง

งาน​วิจัย​ใช้​หนึ่ง​สัปดาห์​เป็น​ขั้น​ต่ำ​เพื่อ​ครอบคลุม​ความ​ต่าง​ของ​แต่ละ​วัน​ใน​สัปดาห์ และ​เตือน​ว่าการ​ทดลอง​นาน​ขึ้น​ไม่​ได้​เพิ่ม​ความ​แม่นยำ​สำหรับ​ตัว​ชี้​วัด​บาง​ตัว ร้าน​จึง​ควร​กำหนด​ระยะ​เวลา​และ​ตัว​ชี้​วัด​หลัก​ไว้​ก่อน​เริ่ม แทน​การ​ตัดสิน​ใจ​หยุด​ตาม​ผล​ราย​วัน

หลัก​เรื่อง​ตัว​ชี้​วัด​หลัก​และ​การ​ไม่​ตัดสิน​จาก​วัน​แรก​ใช้ได้​เหมือน​กัน แต่​แพลตฟอร์ม​โฆษณา​มี​ระบบ​ประมูล​และ​ช่วง​เรียน​รู้​ของ​ตัว​เอง​ที่​ทำให้​ผล​ช่วง​แรก​แกว่ง ก่อน​ทดสอบ​ข้อความ​โฆษณา ร้าน​ควร​ตรวจ​ก่อน​ว่า​คีย์เวิร์ด​ที่​จ่าย​เงิน​อยู่​คุ้ม​หรือ​ไม่ ตาม​ที่​อธิบาย​ไว้​ในรับ​ทำ​โฆษณา Google Ads คีย์เวิร์ด​ไหน​จ่าย​แล้ว​ไม่​คุ้ม เพราะ​การ​ทดสอบ​ข้อความ​บน​คีย์เวิร์ด​ที่​ไม่​ควร​จ่าย​ตั้งแต่​แรก ให้​ผล​ที่​ใช้​ต่อ​ไม่​ได้

งาน​วิจัย​ยก​สถิติ​ว่า​ไอ​เดีย​ส่วน​ใหญ่​ไม่​ได้​ทำให้​ตัว​ชี้​วัด​ดี​ขึ้น​ตาม​ที่​ตั้งใจ ผล​ที่​ไม่​ต่าง​กัน​จึง​เป็น​ผล​ปกติ และ​ช่วย​ให้​ธุรกิจ​ไม่​ต้อง​ลงทุน​เปลี่ยน​สิ่ง​ที่​ไม่​ได้​ช่วย​อะไร ทีม​ควร​บันทึก​ผล​แบบ​นี้​ไว้​พร้อม​สมมติฐาน​เดิม เพื่อ​ไม่​ต้อง​ทดสอบ​ซ้ำ​ใน​อีก​ไม่​กี่​เดือน และ​ใช้​ย้อน​ดู​ได้​ว่า​ไอ​เดีย​กลุ่ม​ไหน​ไม่​เคย​ได้​ผล​ใน​ธุรกิจ​ของ​ตัว​เอง ตาราง​จับ​คู่​ขั้น​ลูกค้า​กับ​วัตถุประสงค์​ของ Meta และ Google Ads อยู่​ในMarketing Funnel สาม​ขั้น​กับ​เป้า​หมาย​แคมเปญ​ของ Google และ Meta ใช้​ประกอบ​การ​เลือก​ว่า​จะ​ทดสอบ​กับ​คนใน​ขั้น​ไหน

PHYGITAL INSIGHT

ฟิจิ⁠ทัล​แยก​คำถาม​สอง​ข้อ​ออก​จาก​กัน​ก่อน​เริ่ม​การ​ทดสอบ​ทุก​ครั้ง ข้อ​หนึ่ง​คือ​หน้า​ไหน​ได้​ผลก​ว่า อีก​ข้อ​คือ​ทำไม​ถึง​ได้​ผล การ​ทดสอบ A/B ตอบ​คำถาม​แรก​ได้​เมื่อ​ทำ​ถูก​วิธี แต่​ตอบ​คำถาม​ที่​สอง​ไม่​ได้ และ​คำถาม​ที่​สอง​คือ​สิ่ง​ที่​ทำให้​ทีม​คิด​แบบ​ถัด​ไป​ได้​ดี​ขึ้น บริการ​วิจัย​ตลาด​ของ​ฟิจิ⁠ทัล​ใช้​การ​สัมภาษณ์​และ​การ​สำรวจ​ผู้​ใช้​จริง​คู่​กับ​ผล​การ​ทดสอบ เพื่อ​ให้​รู้​ทั้ง​ผล​และ​เหตุผล

ให้ PHYGITAL AGENCY ช่วยต่อยอดเรื่องนี้สู่ผลลัพธ์จริง

ผล​ของ​วัน​แรก​มี​โอกาส 67% ที่​จะ​ไม่​ตรง​กับ​ผล​ตอน​จบ​การ​ทดสอบ

ทีม PHYGITAL AGENCY ช่วย​ตั้ง​ตัว​ชี้​วัด​หลัก ระยะ​เวลา และ​การ​ตรวจ​การ​วัดผล​ไว้​ก่อน​เริ่ม​ทดสอบ แล้ว​ใช้​การ​สัมภาษณ์​ผู้​ใช้​จริง​อธิบาย​ว่า​หน้าที่​ชนะ​ได้​ผล​เพราะ​อะไร

PARANATH PANARATANA

WRITTEN BY

PARANATH PANARATANA

CHAIRMAN OF PHYGITAL AGENCY

ประธานกรรมการบริษัท ฟิจิทัล เอเจนซี จำกัด มีประสบการณ์ดูแลการตลาดที่ผสานโลกจริงและโลกออนไลน์เข้าด้วยกัน ตลอดจนเป็นที่ปรึกษาในการวินิจฉัยธุรกิจ อีกทั้งยังเคยทำงานในสายวิดีโอโปรดักชั่นและภาพยนตร์ไทยอีกด้วย