今年年初,我們幫一個電商客戶做 GEO 健檢時發現一件荒謬的事:他的 sitemap.xml 列了 1,400 多個 URL、Google 收錄率 92%,但拿同樣的產品問題去問 ChatGPT 和 Perplexity,AI 引用到他網站的次數是零。爬蟲 log 一拉才知道,GPTBot 有來,但平均每次只抓 3 頁就走——因為它面對的是一片 JavaScript 渲染的產品牆,讀不到重點,也不知道哪些頁面值得讀。

sitemap.xml 解決的是「搜尋引擎找不找得到你」,但 AI 時代的問題變成「語言模型讀不讀得懂你、要不要引用你」。llms.txt 就是為了後者出現的。這篇我們把規格、跟 robots.txt / sitemap.xml 的差異、以及我們在客戶站實際部署的模板一次講完。

1. llms.txt 是什麼:規格三分鐘看懂

llms.txt 是 2024 年由 Answer.AI 的 Jeremy Howard 提出的提案,概念很簡單:在網站根目錄放一個 /llms.txt,內容是 Markdown 格式,讓 LLM(不管是爬蟲階段還是即時檢索階段)能快速理解你的網站結構與重點內容。規格只有四個部分:

另外還有一個進階版 /llms-full.txt,直接把重點頁面的完整內文攤平成一個大 Markdown 檔,讓 AI 一次讀完不用逐頁爬。文件站(像 Anthropic、Vercel、Cloudflare 的開發者文件)採用的多是這種。

2. 跟 robots.txt / sitemap.xml 差在哪

很多人第一反應是「我有 sitemap 了,這不是重複嗎」。不是,三者解決的是完全不同的問題:

維度 robots.txt sitemap.xml llms.txt
回答的問題 「不准爬哪裡」 「所有頁面在哪」 「哪些內容最重要、講什麼」
受眾 所有爬蟲 搜尋引擎 LLM / AI 爬蟲
格式 指令式純文字 XML,機器讀 Markdown,人機皆讀
內容篩選 排除法 全量列舉 策展精選
附帶語意 幾乎無(只有 lastmod) 每條連結有一行人話說明

關鍵差異在「語意」。sitemap.xml 告訴爬蟲 1,400 個 URL 存在,但不告訴它哪 20 個最能代表你。LLM 的 context window 有限、抓取預算也有限——GPTBot 不會把你 1,400 頁全部讀完再下判斷。llms.txt 做的事就是幫它把功課先做完:這是我的定位,這是我最有價值的 20 頁,每頁講什麼。

3. 為什麼是現在:AI 爬蟲的行為變了

我們從三個客戶站的 server log 觀察到,2025 年下半年開始 AI 爬蟲流量結構明顯改變:GPTBot、ClaudeBot、PerplexityBot、Google-Extended 的請求量加總,在其中兩個站已超過 Googlebot 的 40%。更重要的是行為模式不同——傳統爬蟲深度爬、建索引;AI 爬蟲很多是「即時檢索」,使用者在 ChatGPT 問了問題,爬蟲當下來抓 2–5 頁就走。

這種淺抓行為意味著:AI 第一次接觸你的網站,通常只有幾頁的機會決定「你是不是值得引用的來源」。如果它抓到的是導覽頁、tag 彙整頁、或一片需要 JavaScript 才渲染得出來的空殼,你就出局了。llms.txt 的價值是把這幾頁的機會用在刀口上。

這也是我們把 llms.txt 歸在 GEO 實作(Generative Engine Optimization)的第一步的原因:它成本最低——一個純文字檔,不動網站架構、不改 CMS——但直接處理 AI 抓取效率這個瓶頸。

4. 怎麼寫一份好的 llms.txt

我們部署了六個站之後,歸納出四個原則:

原則 1:策展,不是搬運 sitemap

最常見的錯誤是拿 sitemap 轉格式,列 500 條連結。llms.txt 的價值在於「篩選」——我們的經驗值是 10–30 條連結、全文控制在 2,000 token 以內。超過這個量,你等於又把「判斷哪些重要」的工作丟回給 AI。

原則 2:每條連結的一行說明是主戰場

[退貨政策](url)[退貨政策](url): 台灣本島 7 天鑑賞期、跨境訂單 14 天,含免運退貨條件與流程 是兩個世界。後者讓 AI 不用點進去就能回答使用者的問題——而且回答時更可能標注你是來源。寫這行字的心法:想像 AI 要引用你,這行就是它看到的摘要。

原則 3:優先放「能被引用的內容」

AI 引用的是有明確答案的頁面:規格比較、價格、教學步驟、FAQ、數據。首頁、關於我們、形象頁放進去意義不大。我們的排序邏輯:FAQ 與定價 > 教學與指南 > 產品規格頁 > 部落格精選 > 其他。

原則 4:連結指向的頁面本身要能被讀

llms.txt 只是地圖,目的地還是要能進。如果重點頁是 client-side rendering、沒有 SSR 或 prerender,AI 抓到的還是空殼。這時候先解渲染問題,llms.txt 才有意義——我們就遇過一個 SPA 架構的客戶站,llms.txt 上了兩個月沒有任何效果,最後是補了 prerender 之後數字才動起來。

5. 我們的模板

直接給可以抄的版本(以一個假想的電商為例):

# 品牌名 | 一句話定位

> 我們是專注於 [領域] 的 [類型],主要服務 [客群],
> 核心產品為 [產品線],服務範圍涵蓋 [地區/語言]。

## 核心內容
- [產品總覽](https://example.com/products): 全系列 45 款商品,含規格、價格(TWD)與庫存狀態
- [常見問題](https://example.com/faq): 運送時間、退換貨、保固、付款方式等 22 個 FAQ
- [尺寸指南](https://example.com/size-guide): 各產品線尺寸對照表與測量方法

## 指南與評測
- [選購指南](https://example.com/guide/how-to-choose): 依用途與預算的選購決策樹
- [產品比較](https://example.com/compare): 熱門型號規格對比表

## 公司資訊
- [關於我們](https://example.com/about): 成立年份、實體據點、聯絡方式

## Optional
- [部落格](https://example.com/blog): 保養知識與使用技巧文章

部署就是把這個檔案放到網站根目錄,確認 https://你的網域/llms.txt 用 curl 打得到、回 200、Content-Type 是 text/plaintext/markdown。WordPress 站可以用外掛(如 Yoast 已內建)或直接放實體檔案;Shopify 需要走 proxy 或 edge redirect,這是少數比較麻煩的平台。

6. 提交與監控:上了之後怎麼知道有沒有用

llms.txt 沒有像 Search Console 那樣的提交入口——AI 爬蟲自己會來探。你能做的是監控三個訊號:

一個實際案例:某 B2B 設備商客戶部署 llms.txt 加上 FAQ 頁重構後,第 11 週開始在 Perplexity 的產業問題回答中穩定被引用,第四個月從 AI 來源的詢盤有 3 筆、成交 1 筆——單筆金額就超過整個 GEO 專案的費用。樣本很小,我們不會說這是 llms.txt 單獨的功勞,但這條路徑確實通了。

誠實說:llms.txt 不是萬靈丹

必須講清楚的三件事。第一,llms.txt 目前只是社群提案,不是 W3C 或任何官方標準,OpenAI、Anthropic、Google 都沒有公開承諾會遵循它——Google 的 John Mueller 甚至公開表達過保留態度。第二,如果你的網站本身內容單薄、或只有十幾頁,AI 本來就讀得完,llms.txt 帶來的邊際效益趨近於零。第三,它救不了內容品質問題:AI 引用你是因為你的內容值得引用,llms.txt 只是讓它更快找到。

我們對客戶的說法一直是:這是一張成本極低的期權。寫一份好的 llms.txt 加上驗證部署,我們的工時大約 3–4 小時;如果 AI 檢索流量持續成長(趨勢看起來就是如此),這 4 小時的投資報酬會非常可觀;就算最後這個規格沒有成為標準,你在整理它的過程中做的「內容盤點與策展」,對傳統 SEO 一樣有價值。低成本、高上檔、下檔有保底——這種投資沒有理由不做。

結語:先讓 AI 讀得懂你,再談讓 AI 推薦你

GEO 是一整套工程:內容結構化、schema 標記、渲染可讀性、引用監測。llms.txt 是其中門檻最低的一步,也是我們建議所有客戶的起手式——一個下午就能完成,卻直接改變 AI 爬蟲第一次接觸你網站的體驗。

如果你想知道自己的網站在 ChatGPT、Perplexity 眼中長什麼樣子、AI 爬蟲有沒有在爬你、爬到了什麼,加 LINE 傳你的網址給我們,我們會回覆一份簡易的 AI 可讀性健檢——含 llms.txt 建議清單,不收費。

SHARE · 覺得有用?
分享到 LINE 分享到 X ← 回內容專區