SEO & AI

AI ตรวจสอบ robots.txt ได้ไหม? เคสจริงที่ผมไม่ปล่อยประตูเว็บล็อก

AI ตรวจสอบ robots.txt ได้ไหม ภาพประกอบการตรวจสิทธิ์ crawler

AI ตรวจสอบ robots.txt ได้ไหม? ได้ครับ มันอ่านกฎในไฟล์ เทียบกับ URL สำคัญ และบอกได้ว่า Googlebot หรือ AI crawler ตัวไหนกำลังถูกอนุญาตหรือบล็อกอยู่ แต่คำตอบที่มีประโยชน์ไม่ใช่แค่ “syntax ถูก” ต้องตอบต่อว่า หน้าเงินของเรายังเข้าได้จริงไหม ด้วย

robots.txt เป็นไฟล์เล็กมากจนคนมักลืมมันไปเลยครับ ทั้งที่มันเหมือนป้ายหน้าประตูสำนักงาน: บอกแขกแต่ละประเภทว่าเข้าโซนไหนได้บ้าง ถ้าป้ายติดผิด คนที่เราอยากให้เข้าก็หันหลังกลับ ส่วนคนที่ไม่อยากให้เดินไปก็อาจเดินเข้าไปเฉย 555

AI ตรวจ robots.txt ให้เราได้อะไรบ้าง?

AI ช่วยแปลไฟล์ที่ดูเทคนิคให้กลายเป็นรายการความเสี่ยงที่ตัดสินใจได้ครับ โดยเฉพาะตอนมีหลาย user-agent หลาย path และเว็บมีหน้ามากกว่าที่เราจำได้เอง

งานที่ผมให้มันทำไม่ใช่แค่อ่านบรรทัด Allow กับ Disallow แล้วบอกว่าโอเค ผมให้มันตอบเป็นสามชั้น: กฎนี้มีผลกับ bot ไหน, URL สำคัญไหนตรงกฎนั้น, และผลกระทบทางธุรกิจคืออะไร เช่น หน้าขายเข้าได้ไหม หน้าแอดมินถูกกันออกหรือยัง หรือ sitemap ยังถูกประกาศอยู่หรือเปล่า

  • ไล่กฎที่ชนกัน — user-agent เฉพาะกับกฎรวมอาจให้ผลต่างกัน
  • เทียบ URL จริง — หน้าแรก, หน้าขาย, blog, รูป และ URL ที่อยู่ใน sitemap
  • หา path ที่เสี่ยง — เช่น เผลอ Disallow กว้างเกินไป หรือเปิดโฟลเดอร์ชั่วคราว
  • แยก crawler ตามเจตนา — bot ของ search, bot ที่ผู้ใช้เรียกมาเปิดหน้า, และ bot ที่มีนโยบายใช้งานต่างกัน

เคสจริงที่ผมตรวจเว็บตัวเองเจออะไร?

เคสจริงของผมคือเว็บนี้มีบทความอยู่ 183 ไฟล์ และ sitemap ที่เผยแพร่ออกไปมี 186 URL ณ วันที่ผมตรวจ ถ้าผมเปิดดูทีละหน้าเพื่อเดาว่า crawler เข้าได้หมดไหม ก็คงเสียเวลาไปกับงานที่ไม่มีใครอยากทำครับ

ผมจึงให้ AI อ่าน robots.txt แล้วไล่เทียบกับ sitemap ผลที่อยากได้ไม่ใช่ report ยาวสิบหน้า แต่เป็นเช็กลิสต์สั้น ๆ: กฎรวมอนุญาตหน้าเว็บ, มีการกัน /tmp/ กับ /downloads/, sitemap ชี้ URL ถูกต้อง และมี user-agent เฉพาะ 6 กลุ่มที่ระบุการเข้าถึงไว้ชัดเจน รวมถึง GPTBot, ChatGPT-User, ClaudeBot, PerplexityBot และ Google-Extended

ตัวเลข 186 URL นี่แหละครับที่ทำให้ผมไม่อยากพึ่งความรู้สึก เพราะไฟล์เดียวเปลี่ยนผิดบรรทัดเดียว มันไม่ได้กระทบหน้าเดียวเหมือนแก้คำสะกด มันอาจเปลี่ยนทางเข้าของทั้งเว็บได้เลย หลักเดียวกับตอนที่ผมให้ AI ตรวจ Technical SEO จากหลักฐานจริง: ให้มันวงจุดที่ต้องดูให้ครบ แล้วคนค่อยตัดสินใจว่าจะเปลี่ยนอะไร

robots.txt ต่างจาก noindex และ sitemap ยังไง?

สั้นที่สุดคือ robots.txt บอก crawler ว่าควรเข้าไป crawl ทางไหน, noindex บอกว่าเข้าหน้าได้แต่ไม่อยากให้แสดงในผลค้นหา, ส่วน sitemap คือแผนที่เสนอ URL ที่เราอยากให้ crawler รู้จักครับ ทั้งสามอย่างไม่ใช่ปุ่มเดียวกัน

คนมักใช้ robots.txt แก้ทุกเรื่อง เพราะมันแก้ได้ง่ายและดูเหมือน “ซ่อนหน้า” ได้ แต่จริง ๆ ถ้าหน้าถูกลิงก์จากที่อื่น Google อาจยังรู้ว่ามี URL นั้นอยู่ แม้จะไม่ crawl รายละเอียดให้ครบ การกันหน้าที่มีข้อมูลส่วนตัวจึงต้องใช้ authentication ไม่ใช่หวังพึ่ง robots.txt อย่างเดียว

ผมชอบอธิบายว่า sitemap คือแผนที่แจกพนักงานส่งของ, robots.txt คือป้ายห้ามเข้าบางห้อง, และ noindex คือป้ายบอกว่าเข้ามาดูได้แต่ไม่ต้องเอาไปลงโบรชัวร์ ถ้าเอาป้ายคนละชนิดไปใช้ หน้าตาเหมือนทำงานแล้ว แต่ผลลัพธ์อาจไม่ตรงที่ต้องการครับ

ทำไมต้องให้ AI ตรวจ URL จริง ไม่ใช่ดู syntax อย่างเดียว?

เพราะไฟล์ที่ valid ไม่ได้แปลว่าตั้งใจถูกครับ AI ช่วยเอากฎนามธรรมไปลองกับ URL ที่มีผลกับรายได้ ทำให้เห็นผลก่อนคนค้นหาจะหาหน้าเราไม่เจอ

ตัวอย่างง่าย ๆ คือมีคนเติม Disallow: /blog/ เพื่อกันหน้าทดลอง แล้วลืมเอาออก Syntax สวยมาก ไม่มี error เลย แต่บทความ 180 กว่าหน้ากลายเป็นส่วนที่ crawler ไม่ควรเข้า หรือมีคนเขียน Disallow: /download โดยไม่เห็นว่า URL หน้าสำคัญใช้คำขึ้นต้นแบบเดียวกัน

วิธีที่ผมใช้คือหยิบ URL ตัวแทนมาให้มันเทียบเสมอ: หน้าแรก, หน้าบล็อก, หน้าบทความใหม่, หน้าสินค้า, หน้า login, หน้าแอดมิน และ URL จาก sitemap สักชุดหนึ่ง จากนั้นให้รายงาน “allowed/blocked เพราะกฎบรรทัดไหน” ไม่รับคำตอบกว้าง ๆ ว่า “ไฟล์ดูปกติ” ครับ

ควรเปิด AI crawler ทุกตัวเลยไหม?

ไม่ควรเปิดหรือปิดเพราะเห็นคนอื่นทำครับ ควรแยกก่อนว่า bot นั้นมาทำอะไร และนโยบายของเว็บเรายอมรับสิ่งนั้นไหม การเปิด crawler เพื่อให้ระบบค้นหาและอ้างอิงเนื้อหาได้ กับการอนุญาตใช้เนื้อหาเพื่อวัตถุประสงค์อื่น เป็นคนละการตัดสินใจ

เว็บผมเลือกเขียนกฎให้ชัด เพราะผมอยากให้เนื้อหาที่เขียนจากประสบการณ์จริงมีโอกาสถูกค้นพบทั้งบน search engine และ AI engine แต่ผมจะไม่เอานโยบายของตัวเองไปบอกว่าเหมาะกับทุกธุรกิจ เว็บสมาชิก เว็บที่มีเนื้อหาจากลูกค้า หรือเว็บที่ขายข้อมูลเฉพาะทาง อาจต้องการข้อจำกัดคนละแบบเลย

ที่สำคัญ อย่าคิดว่า robots.txt คือระบบสิทธิ์เข้าถึงครับ มันเป็นคำขอความร่วมมือกับ crawler ที่เชื่อฟังกติกา ไม่ใช่กลอนประตู ถ้าข้อมูลไม่ควรเปิดต่อสาธารณะ ต้องปิดด้วย login, permission หรือเอาไฟล์ออกจาก public path

เริ่มตรวจ robots.txt ด้วย AI แบบปลอดภัยยังไง?

เริ่มได้โดยไม่ต้องซื้อ SEO tool แพงครับ ให้ AI ทำหน้าที่คนตรวจเอกสารก่อน ไม่ใช่คนกด deploy แทนเรา แล้วทุกการเปลี่ยนต้องมี URL ที่ทดสอบหลังแก้

  1. เปิด /robots.txt ของโดเมนจริง ไม่ใช่ไฟล์ในเครื่องที่อาจยังไม่ได้ deploy
  2. รวบรวม URL สำคัญและ sitemap ปัจจุบัน
  3. บอก AI ว่า bot และ path ไหน “ต้องเข้าได้” กับอะไร “ต้องกัน”
  4. ให้มันสรุปกฎที่มีผลต่อแต่ละ URL พร้อมบรรทัดอ้างอิง
  5. ถ้าต้องแก้ ให้ทำ patch เล็ก ๆ, review, deploy แล้วเปิดตรวจ URL เดิมซ้ำ

เรื่องนี้เข้าคู่กับการ ให้ AI เช็กระบบก่อน deploy มากครับ เราไม่ได้พยายามให้ AI เป็นเจ้าของเว็บ แต่ลดโอกาสที่คนจะพลาดสิ่งเล็ก ๆ ซึ่งผลกระทบกลับใหญ่เกินตัว

ถ้าอยากฝึกใช้ AI ทำงานแบบมีหลักฐานและมีจุดตรวจ ผมสอนไว้ใน คอร์ส LearnAI ครับ เป้าหมายไม่ใช่จำคำสั่งทุกคำ แต่คือทำให้ AI รู้ว่าอะไรคือเกณฑ์ผ่านของงานเรา

ข้อผิดพลาดที่ผมไม่ให้ AI ทำเอง

AI ควรตรวจและร่างข้อเสนอได้ แต่ไม่ควรแก้ robots.txt บน production เองแบบไร้คนเห็นครับ เพราะผลของมันกว้างและบางทีต้องใช้เวลาจน crawler กลับมา crawl รอบใหม่ถึงจะรู้ผล

ผมตั้งเส้นไว้ชัด: AI อ่านไฟล์, ดึง URL, ร่าง patch และอธิบายผลกระทบได้; คนอนุมัติการเปลี่ยนกฎรวม, การบล็อกทั้งหมวด, การเปลี่ยนนโยบาย crawler และการ deploy การทำแบบนี้ไม่ได้ช้าลงอย่างที่คิด เพราะคนไม่ต้องเสียเวลาขุดข้อมูล แต่ยังรักษาจุดที่ควรใช้ judgement ไว้

คำถามที่พบบ่อย

AI ตรวจสอบ robots.txt ได้ไหม?

ได้ครับ AI อ่านกฎ robots.txt, เทียบกับ URL สำคัญ และสรุปได้ว่า crawler ตัวไหนเข้าอะไรได้บ้าง แต่ก่อนแก้ไฟล์จริงควรมีคนตรวจผลกระทบเสมอ

robots.txt ผิดแล้ว SEO พังไหม?

พังได้ถ้าบล็อกหน้าสำคัญหรือไฟล์ที่ Google ต้องใช้ render หน้าเว็บ แต่ robots.txt ไม่ได้ลบหน้าจาก Google ทันที จึงควรตรวจ Search Console, meta robots และ canonical ร่วมกัน

ควรอนุญาต AI crawler ใน robots.txt ไหม?

ขึ้นกับนโยบายธุรกิจและชนิด crawler ครับ ควรแยกให้ชัดระหว่าง bot ที่ใช้ค้นหาหรืออ้างอิงกับ bot ที่ใช้ฝึกโมเดล แล้วตัดสินใจจากสิ่งที่เว็บไซต์ยอมให้ใช้จริง

ต้องแก้ robots.txt บ่อยแค่ไหน?

ตรวจทุกครั้งก่อน deploy ที่แตะ routing, CMS, CDN หรือไฟล์ SEO และตรวจซ้ำเป็นรอบเมื่อเพิ่มหน้าขายหรือเปลี่ยนโครงสร้างเว็บครับ

ถ้าคุณอยากมีผู้ช่วยที่ไม่ได้แค่บอกว่าไฟล์ “น่าจะโอเค” แต่เปิดหลักฐาน ไล่ URL และทำ checklist ก่อนคุณตัดสินใจ ลองดู Newton ครับ ผมสร้างมันจากวิธีที่ใช้ให้ AI ช่วยดูแลงานจริงแบบนี้นี่แหละ

— Pond