ผู้วิจัยเรียกระบบค้นหาที่ใช้ AI สรุปคำตอบว่า Generative Engine ระบบแบบนี้ค้นแหล่งข้อมูลมาก่อน แล้วให้โมเดลภาษาเขียนคำตอบที่รวมหลายแหล่งไว้ในย่อหน้าเดียวพร้อมอ้างอิง ปัญหาของเจ้าของเว็บคือการมองเห็นไม่ได้วัดจากอันดับหนึ่งถึงสิบอีกต่อไป แต่วัดจากว่าคำตอบหยิบเนื้อหาของเว็บไปใช้มากแค่ไหนและวางไว้ตรงไหน
ระบบที่ใช้ทดลองดึงห้าแหล่งแรกจากผลค้นหาของ Google ต่อหนึ่งคำถาม แล้วให้โมเดล gpt-3.5-turbo เขียนคำตอบ ผู้วิจัยวัดการมองเห็นสองแบบ
- จำนวนคำที่ถ่วงตามตำแหน่ง นับว่าคำตอบใช้คำจากแหล่งนั้นมากเท่าไร โดยให้น้ำหนักกับส่วนที่อยู่ต้นคำตอบมากกว่า
- ความประทับใจเชิงอัตวิสัย ให้โมเดลภาษาประเมินเจ็ดด้าน เช่น ความเกี่ยวข้อง ความโดดเด่นของตำแหน่ง และโอกาสที่ผู้ใช้จะกดดูแหล่ง
ชุดทดสอบ GEO-bench มี 10,000 คำถามจาก 25 หมวด เช่น ศิลปะ สุขภาพ และเกม ครอบคลุมคำถามเก้าประเภท ตั้งแต่คำถามหาข้อมูลไปจนถึงคำถามที่ต้องการซื้อ คำถามมาจากเก้าแหล่ง ส่วนหนึ่งเป็นคำค้นจริงที่ปิดชื่อผู้ใช้จาก Bing และ Google อีกส่วนมาจากหัวข้อยอดนิยมบน Perplexity คำถามจากชุมชนที่ขอคำอธิบายแบบง่าย และคำถามที่ GPT-4 สร้างเพิ่ม ผู้วิจัยแบ่งเป็นชุดฝึก 8,000 ข้อ ชุดตรวจ 1,000 ข้อ และชุดทดสอบ 1,000 ข้อ โดยรักษาสัดส่วนคำถามหาข้อมูลไว้ 80% คำถามที่ต้องการทำรายการ 10% และคำถามที่ต้องการไปยังเว็บใดเว็บหนึ่ง 10%
ถามคำถามเดิมซ้ำ ทำไม AI ตอบไม่เหมือนเดิม
โมเดลภาษาสุ่มถ้อยคำทุกครั้งที่ตอบ ผู้วิจัยจึงให้ระบบเขียนคำตอบห้าครั้งต่อคำถามแล้วนำผลมาเฉลี่ย เพื่อลดความคลาดเคลื่อนจากการสุ่ม เจ้าของเว็บที่ลองถาม AI ครั้งเดียวแล้วไม่เห็นชื่อเว็บของตัวเอง จึงยังสรุปไม่ได้ว่าเว็บไม่ถูกหยิบ ต้องถามซ้ำหลายรอบและดูสัดส่วน
GEO กับ SEO วัดความสำเร็จต่างกันอย่างไร
SEO วัดอันดับของหน้าในรายการผลค้นหา GEO ในงานวิจัยนี้วัดสัดส่วนและตำแหน่งของเนื้อหาในคำตอบที่ AI เขียน เว็บหนึ่งอาจอยู่อันดับหนึ่งของผลค้นหาแต่ถูกอ้างเพียงประโยคเดียวในคำตอบ หรืออยู่อันดับห้าแต่ถูกหยิบไปเป็นย่อหน้าแรก