robots.txt 是網站的「守門員」,決定哪些爬蟲可以進來。但很多網站不小心把 AI 爬蟲(GPTBot、ClaudeBot 等)擋在門外,等於放棄整個 AI 搜尋市場。這篇白話教你 robots.txt 怎麼設定才對。
用生活比喻秒懂 robots.txt
🚪 生活比喻:robots.txt 就像你店門口的守門員,手上有一張名單,決定誰能進、誰不能進。設定錯誤,就像把「想幫你介紹客人的貴賓」(AI 爬蟲)擋在門外——它進不來,就沒辦法認識你、推薦你。
robots.txt 是什麼?
robots.txt 是放在網站根目錄的文字檔,用來告訴各種爬蟲「哪些頁面可以抓、哪些不要抓」。它不是用來擋壞人(沒有強制力),而是給守規矩的爬蟲一份指引,例如 Googlebot、以及各家 AI 的爬蟲。
2026 一定要開放的 AI 爬蟲
🤖
OpenAI
GPTBot、OAI-SearchBot、ChatGPT-User
🧠
Anthropic / Perplexity
ClaudeBot、Claude-Web、PerplexityBot
🔎
Google AI / 其他
Google-Extended、Applebot-Extended、CCBot
基本設定範例
User-agent: * Disallow: /wp-admin/ Allow: /wp-admin/admin-ajax.php # 明確開放主流 AI 爬蟲 User-agent: GPTBot Allow: / User-agent: ClaudeBot Allow: / User-agent: PerplexityBot Allow: / User-agent: Google-Extended Allow: / Sitemap: https://yoursite.com/sitemap.xml
常見錯誤
1
不小心整站封鎖
Disallow: / 會擋掉全站,是最嚴重的錯誤,會讓網站從搜尋消失。
2
把 AI 爬蟲全擋掉
擔心內容被 AI 用而全面封鎖,結果放棄了 AI 搜尋帶來的曝光。
3
忘了放 Sitemap
robots.txt 應指向正確的 sitemap,幫助爬蟲有效率地收錄。
🏢
甫東科技的 robots.txt 設定
甫東科技為客戶設定 robots.txt 時,會明確開放主流 AI 爬蟲、擋掉不必要的目錄、並指向正確的 sitemap,讓網站同時對 Google 與各家 AI 友善。設定錯一行,可能讓網站從搜尋消失——這是需要專業把關的細節。
甫東科技為客戶設定 robots.txt 時,會明確開放主流 AI 爬蟲、擋掉不必要的目錄、並指向正確的 sitemap,讓網站同時對 Google 與各家 AI 友善。設定錯一行,可能讓網站從搜尋消失——這是需要專業把關的細節。
延伸閱讀
📎 2026 網站 SEO、GEO、AIO 完整攻略:15 大技巧,讓品牌被 Google 與 AI 同時看見 →📎 llms.txt 怎麼寫?教你遞一張「名片」給 ChatGPT 和 Google AI →📎 官網被 AI 引用的 8 個檢查清單,你的網站做到幾項? →
常見問題 Q&A
robots.txt 設錯會怎樣?
嚴重時(如 Disallow: /)會讓整站從 Google 消失。設定需謹慎,建議由專業確認。
要開放 AI 爬蟲嗎?內容會被 AI 拿走嗎?
開放能讓你被 AI 搜尋引用、獲得曝光。若完全封鎖,等於放棄 AI 搜尋市場,通常得不償失。
robots.txt 能擋惡意爬蟲嗎?
不能。robots.txt 只對守規矩的爬蟲有效,惡意爬蟲不會理會,需用其他資安手段防護。
怎麼檢查 robots.txt 有沒有設對?
可用 Google Search Console 的 robots.txt 測試工具,或請專業團隊檢視,避免誤擋重要頁面。
首圖來源:Pexels/攝影:Markus Spiske