在网站运营中,我们常会遇到搜索引擎蜘蛛(如百度蜘蛛、谷歌蜘蛛)频繁抓取一些“标签页”——比如分类标签、搜索筛选页、参数组合页等,这些页面内容重复、价值低,却会大量消耗服务器资源,甚至导致网站被判定为“重复内容”而降权。怎么禁止蜘蛛抓取标签页?下面是一套简单有效的技术方案。
并不是所有带“?tag=”或“/tag/”的页面都需要屏蔽,你要优先分析网站日志,看蜘蛛是否在反复抓取以下类型:
建议只保留那些真正提供独特内容的标签页(热门标签”专题),其余一律屏蔽。
最直接的方法是在网站根目录的robots.txt文件中声明禁止规则。
User-agent: *Disallow: /tag/Disallow: /search/Disallow: /products?*注意:
User-agent: *代表所有蜘蛛,也可以只针对百度(Baiduspider)或谷歌(Googlebot)。 如果有些标签页已经被搜索引擎收录,或者你希望保留爬取能力但禁止索引,可以在页面的<head>中插入:
<meta name="robots" content="noindex, follow">
noindex:禁止搜索引擎将此页面加入索引库。 follow:允许蜘蛛继续顺着此页面的链接去爬取其他页面(如你希望蜘蛛从标签页去往详情文)。对于动态生成的标签页,可以修改网站模板,统一添加该标签;若是静态页,需逐一修改,也可利用CDN或WAF(Web应用防火墙)在响应头中动态注入X-Robots-Tag: noindex。
noindex而不是完全屏蔽爬取,这样蜘蛛仍能通过标签页发现你其他文章。 掌握禁止蜘蛛抓取标签页的方法,本质是减少对搜索引擎的“噪音”,将有限的爬取额度让给真正有价值的内容页(如文章、商品详情页),才能提升网站权重,避免服务器无谓负载,当你的站点每天被蜘蛛抓取数千次,其中一半是重复标签页时——今天就可以按以上三步动手优化了。
相关文章:
0.9408s , 5866.1484375 kb Copyright 2023 Powered by SEO优化多久能看到效果sitemap