适用场景

AI 搜索带来的变化是:用户不再点开十个链接,而是直接看答案。站点要做的是「被 AI 引用」。做法不神秘:结构清晰、内容具体、事实可核、授权明确。

配置步骤(llms.txt 与 AI 爬虫策略)

# 1) llms.txt 结构(放在站点根,纯文本 Markdown)
cat /www/sites/tfor.cn/index/llms.txt
# 建议包含:
#  - 组织简介(一句话 + 关键能力)
#  - 主要栏目与链接
#  - 权威内容示例(服务/方案/常见问题)
#  - 联系方式与更新时间

# 2) 爬虫策略(robots.txt 片段示例)
# 允许检索型爬虫
User-agent: GPTBot
Allow: /

User-agent: Bytespider
Allow: /

# 纯采集无引用的可限制(按自身策略决定)
User-agent: CCBot
Disallow: /

# 3) 验证可访问
curl -sS -o /dev/null -w 'llms.txt http=%{http_code}\n' https://example.com/llms.txt
curl -sS -o /dev/null -w 'robots  http=%{http_code}\n' https://example.com/robots.txt

关键参数与建议

  • llms.txt:用简洁结构说明站点是什么、有哪些栏目、哪些内容权威
  • 爬虫策略:对 AI 爬虫按意图区分(要引用的放行、纯采集的按策略限制)
  • 内容结构:一问一答、小标题清晰、结论前置,便于被摘录
  • 事实密度:给具体型号、参数、命令、数值,避免空话
  • 实体明确:公司名、品牌、联系方式、地址在页面与结构化数据中一致
  • 可核验:引用来源、更新日期、作者信息完整(E-E-A-T)
  • 监测:定期在主流 AI 助手里问行业问题,看是否引用本站
  • 迭代:被引用的话题继续加厚,未被引用的补齐事实与结构

容易踩的坑

  • llms.txt 写了几千字,AI 抓取时截断,关键信息看不到
  • robots.txt 一刀切禁止所有非搜索引擎爬虫,AI 引用机会也没了
  • 内容页需要登录,AI 抓不到(要引用就让可抓内容公开)
  • llms.txt 列出的链接是 404 或重定向
  • 站点主体信息在中英文页面不一致,实体识别混乱
  • 上线后从不更新,栏目调整了文件还是旧的

验证与巡检

curl -sS -o /dev/null -w 'llms.txt %{http_code}\n' https://example.com/llms.txt
curl -sS https://example.com/llms.txt | head -20
curl -sS https://example.com/robots.txt | grep -i -A1 'gptbot|bytespider|ccbot'

# 抽查 llms.txt 中列出的 5 个链接全部 200
  • 巡检:llms.txt 可访问且链接有效、爬虫策略符合预期、每季度随栏目更新

小结

AI 搜索优化验收:在主流 AI 助手里提问本行业典型问题,能引用本站内容或给出本站链接;llms.txt 与结构化数据被正确读取。

> 说明:文中命令为通用写法,不同型号/版本可能略有差异,落地前请对照设备实际版本的官方文档;带外管理与安全设备变更建议先在测试设备验证。