企业官网Robots.txt怎么写:正确引导搜索引擎爬取重要页面
什么是Robots.txt,为什么企业官网必须重视
Robots.txt是放在网站根目录下的一个纯文本文件,搜索引擎的爬虫在抓取网站内容之前,第一件事就是读取这个文件。它告诉爬虫哪些页面可以抓取、哪些页面不要碰。
很多企业主觉得这个文件不重要,实际上,一个配置错误的robots.txt可能导致整站从百度搜索结果中消失。我们在服务客户时就遇到过这样的案例:一家企业网站上线三个月百度收录为零,排查下来发现是建站时留下了一行 Disallow: /,直接把所有搜索引擎挡在了门外。
Robots.txt基础语法详解
robots.txt的语法非常简单,核心只有几个指令:
User-agent:指定爬虫
User-agent 用来指定规则针对哪个搜索引擎的爬虫。* 表示所有爬虫,Baiduspider 专指百度爬虫,Googlebot 专指谷歌爬虫。
Disallow:禁止抓取
Disallow: /admin/ 表示禁止爬虫访问 /admin/ 目录下的所有页面。Disallow: 后面为空表示允许抓取所有内容。
Allow:允许抓取
Allow 用来在 Disallow 的范围内开放特定路径。比如禁止了 /system/ 但允许 /system/static/,可以这样写:
User-agent: *
Disallow: /system/
Allow: /system/static/
Sitemap:告知地图位置
在robots.txt底部加上 Sitemap: https://www.example.com/sitemap.xml,让搜索引擎自动发现你的网站地图。
企业官网的推荐配置模板
一个典型的企业官网robots.txt应该长这样:
User-agent: *
Disallow: /admin/
Disallow: /cache/
Disallow: /data/
Disallow: /system/
Allow: /system/static/
Sitemap: https://www.example.com/sitemap.xml
核心原则很清楚:后台管理目录、缓存目录、数据库配置目录、系统核心文件目录全部禁止,只开放前端可访问的内容页面和静态资源。
五个最常见的Robots.txt错误
错误一:全站屏蔽
User-agent: *
Disallow: /
这两行代码会把所有搜索引擎全部挡住,整站不会被收录。开发环境或测试环境可能会加这个配置,上线时忘了改就是灾难。
错误二:Disallow后面多了空格
Disallow: / 后面多一个空格,部分爬虫可能解析异常。虽然主流搜索引擎已经能容错处理,但规范书写更保险。
错误三:把CSS和JS也屏蔽了
有些网站把整个 /static/ 目录都屏蔽了,导致百度爬虫无法读取CSS和JavaScript文件。百度明确表示,如果爬虫无法渲染页面,会影响排名评估。
错误四:文件编码不是UTF-8
robots.txt必须是UTF-8编码的纯文本文件,不能用BOM头。如果用Windows记事本保存,要注意选择"UTF-8无BOM"格式。
错误五:文件没有放在根目录
robots.txt只在网站根目录下生效,放在子目录里搜索引擎是不会读取的。
针对百度和Google的差异化配置
百度和Google在robots.txt解析上存在一些差异。如果你的网站同时面向百度和谷歌搜索,可以分开配置:
User-agent: Baiduspider
Disallow: /admin/
Disallow: /cache/
Disallow: /data/
Crawl-delay: 5
User-agent: Googlebot
Disallow: /admin/
Disallow: /cache/
Disallow: /data/
User-agent: *
Disallow: /admin/
Disallow: /cache/
Disallow: /data/
Sitemap: https://www.example.com/sitemap.xml
Crawl-delay 指令用来限制爬虫的抓取频率。百度支持这个指令,设置为5表示每5秒最多抓取一次。对于小型企业网站,适当限制抓取频率可以减轻服务器压力。需要注意的是,Google不支持Crawl-delay指令,需要在Google Search Console里单独设置抓取速度。
用百度抓取诊断工具验证配置
写好robots.txt之后,一定要用百度搜索资源平台的"抓取诊断"功能验证。进入平台后选择你的站点,在"抓取诊断"里输入几个重要页面的URL,看看百度爬虫能不能正常抓取。
如果返回结果显示被robots.txt屏蔽,说明配置有问题,赶紧修改。如果显示抓取成功并且页面内容完整,说明配置正确。
另一个实用的检查方法是直接在浏览器中访问 https://你的域名/robots.txt,确认文件内容与预期一致。
Robots.txt与Sitemap的配合使用
robots.txt负责告诉搜索引擎"不要抓什么",sitemap负责告诉搜索引擎"有什么值得抓"。两者配合使用效果最好。
在robots.txt中声明sitemap地址之后,搜索引擎会自动发现并读取你的网站地图,从而更快地发现新发布的页面。对于经常更新内容的企业网站,这个配合能显著加速新内容的收录速度。
广州万户网络在为客户做网站SEO优化时,会在建站阶段就规划好robots.txt和sitemap的配置方案,确保搜索引擎能高效抓取所有重要页面。如果你的企业官网收录情况不理想,欢迎联系万户网络(电话:020-22103921 / 135-3532-1113)进行SEO诊断,我们会从robots.txt配置开始逐项排查,找到问题并解决。更多SEO优化资讯请访问 https://www.gzwanhu.com/ 。
需要网站建设、软件开发或爬虫定制?
模板建站1280元起,价格公开不加价。电话/微信 13535321113
