如何通过 noindex 阻止网页被搜索引擎编入索引?

简介: 在一些网站中,通过`robots.txt`可以控制哪些站点资源或目录能被搜索引擎索引,但是随着站点页面增加,之前允许的索引页面常常不希望被索引,如果直接修改 `robots.txt`,影响会比较大,所以页面级的控制就很有必要。

在一些网站中,通过robots.txt可以控制哪些站点资源或目录能被搜索引擎索引,但是随着站点页面增加,之前允许的索引页面常常不希望被索引,如果直接修改 robots.txt,影响会比较大,所以页面级的控制就很有必要。

前一篇有提到通过在站点根目录 robots.txt 文件中添加 Disallow 指令来阻止整站级别的某些资源被搜索引擎索引或不被索引,一文搞懂SEO优化之站点robots.txt。为了精细化控制被索引的页面,有时也需要通过noindex处理。

为让 noindex 生效,网页或资源需要不被 robots.txt 文件的规则屏蔽,并且必须能被访问。如果被 robots.txt 文件屏蔽或无法访问该网页,那么爬虫就永远看不到 noindex 规则,所以该网页可能仍会显示在搜索结果中,例如有其他网页链接到该网页。

有两种方式配置 noindex :一是作为 <meta> 标记,二是作为 HTTP 响应标头。这两种方法的效果相同,根据网站实际情况选择合适的方法即可。

1 Meta Robots 标签(控制单页索引行为)

在HTML的<head>中添加,精准控制单个页面是否被索引或跟踪链接。

支持的指令

指令 说明
all 无限制,为默认值
noindex 不在搜索结果中显示此网页、媒体或资源
nofollow 不追踪该网页上的链接
none 等同于 noindex, nofollow
nosnippet 不在搜索结果中显示该网页的摘要或视频预览
indexifembedded 如果网页通过 iframes 嵌入到其他网页,该网页内容也会被编入索引
max-snippet: [number] 最多只能使用 [number] 个字符作为搜索结果的文字摘要。为0时,不显示摘要。等同于 nosnippet;为-1时,不限制
max-image-preview: [setting] 设置网页的图片预览在搜索结果中的尺寸上限。为none时,不显示图片预览;为standard时,可能会显示默认图片预览;为large时,可能显示较大图片预览
max-video-preview: [number] 设置网页的视频预览在搜索结果中的最长秒数。为0时最多显示静态图;为-1时无显示;
notranslate 不在搜索结果中提供该网页的译文
noimageindex 不将该网页上的图片编入索引
unavailable_after: [date/time] 在指定日期/时间过后,不在搜索结果中显示该网页

HTML示例

<!-- 禁止所有爬虫 -->
<meta name="robots" content="noindex, nofollow">
<!-- 仅禁止Google -->
<meta name="googlebot" content="noindex">

<!-- 阻止在搜索结果中显示摘要 -->
<meta name="robots" content="max-snippet:0">
<!-- 摘要最多显示20个字符 -->
<meta name="robots" content="max-snippet:20">
<!-- 不限制 -->
<meta name="robots" content="max-snippet:-1">

<!-- 不显示预览图 -->
<meta name="robots" content="max-image-preview:standard">

<!-- 2025-08-01之后不在结果中显示该网页 -->
<meta name="robots" content="unavailable_after: 2025-08-01">

🌐 2 HTTP 头:X-Robots-Tag (服务器级控制)

通过服务器配置HTTP响应头X-Robots-Tag,其值为 noindexnone动态控制索引行为 可用于非HTML文件(如PDF、视频文件或图片等)。

HTTP/1.1 200 OK
(...)
X-Robots-Tag: noindex, nofollow
(...)

或指定爬虫引擎

HTTP/1.1 200 OK
(...)
X-Robots-Tag: googlebot: nofollow
X-Robots-Tag: otherbot: noindex, nofollow
(...)

服务端配置示例

以nginx配置为例,比如希望所有pdf文件禁止被索引:

location ~* \.pdf$ {
   
  add_header X-Robots-Tag "noindex, nofollow";
}

✅ 优势:无需修改页面代码,适合批量管理或程序化生成的内容。

💎 根据场景选择方案

需求场景 推荐方案
整站/目录禁止抓取 robots.txt
精准控制单页索引/链接跟踪 Meta Robots 标签
动态文件或服务器级批量控制 X-Robots-Tag HTTP 头

实际业务中,建议同时使用 robots.txt + noindex 组合。

原文地址:如何通过 noindex 阻止网页被搜索引擎编入索引?

相关文章
|
9月前
|
存储 监控 安全
阿里云渠道商:云服务器价格有什么变动?
阿里云带宽与存储费用呈基础资源降价、增值服务差异化趋势。企业应结合业务特点,通过阶梯计价、智能分层、弹性带宽等策略优化成本,借助云监控与预算预警机制,实现高效、可控的云资源管理。
|
9月前
|
安全 API PHP
拥抱现代PHP:探索枚举(Enum)的力量
拥抱现代PHP:探索枚举(Enum)的力量
597 104
|
7月前
|
CDN
阿里云 ESA 边缘加速(免费版) - 领取CDN加速免费套餐
阿里云ESA免费版全面开放!无论国际站或中国站用户,均可免费申请,享受无限流量CDN服务,大幅提升网站访问速度。
3408 7
|
前端开发 API 开发者
harmonyOS基础- 快速弄懂HarmonyOS ArkTs基础组件、布局容器(前端视角篇)
本文由黑臂麒麟(6年前端经验)撰写,介绍ArkTS开发中的常用基础组件与布局组件。基础组件包括Text、Image、Button等,支持样式设置如字体颜色、大小和加粗等,并可通过Resource资源引用统一管理样式。布局组件涵盖Column、Row、List、Grid和Tabs等,支持灵活的主轴与交叉轴对齐方式、分割线设置及滚动事件监听。同时,Tabs组件可实现自定义样式与页签切换功能。内容结合代码示例,适合初学者快速上手ArkTS开发。参考华为开发者联盟官网基础课程。
1470 75
harmonyOS基础- 快速弄懂HarmonyOS ArkTs基础组件、布局容器(前端视角篇)
|
数据采集 XML 搜索推荐
一文搞懂SEO优化之站点robots.txt
建站后千万别忘记配置 `robots.txt` 爬虫规则,对于搜索引擎发现你的站点非常重要,除了主动到搜索引擎平台提交网站之外,也要主动告诉搜索引擎网站里都有哪些网页?哪些希望被抓取?哪些不希望被抓取?
961 3
|
安全 网络协议 Linux
yum出现Loaded plugins: fastestmirror, security Loading mirror speeds from cached hostfile解决方法
yum出现Loaded plugins: fastestmirror, security Loading mirror speeds from cached hostfile解决方法
3911 3
|
移动开发 HTML5
HTML5实现的手机验证抽奖领券效果源码
这是一款基于HTML5实现的手机验证抽奖领券效果源码。在输入框输入手机号码即可点击下方的按钮来进行抽奖游戏,中奖后还会弹出提示信息,是一款比较经典的抽奖游戏源码
437 9
|
域名解析 存储 缓存
【域名解析DNS专栏】动手实践:手动配置DNS解析记录
【5月更文挑战第22天】本文介绍了DNS解析记录的概念及其手动配置步骤。DNS解析记录是将域名映射到IP地址的数据,常见类型包括A(IPv4)、AAAA(IPv6)和CNAME(别名)。配置步骤包括登录DNS管理平台,添加记录,选择记录类型,填写主机记录和记录值,设置TTL值,并保存。以阿里云为例的A记录配置示例也提供了具体操作。了解这些有助于更好地管理域名。
2680 0
【域名解析DNS专栏】动手实践:手动配置DNS解析记录
|
前端开发 JavaScript API
前端框架对比和选择
前端框架对比和选择
|
数据采集 搜索推荐 JavaScript
禁止搜索
【7月更文挑战第9天】
1200 1