知识库文章

Googlebot 多久抓取一次?用日志查重要页面

文章摘要
Googlebot没有固定回访天数。先在GSC查页面上次抓取,再用日志区分正常访问、服务器错误、安全拦截和无记录,按结果处理。

本页阅读目录

实际抓取怎样确认教学示意:核 Googlebot 身份、边缘与源站日志、逐 URL 时间状态;只对已覆盖窗口作结论

Googlebot 没有“每三天来一次”这样的固定安排。它是 Google 读取网页的程序,来访频率会随页面更新、网站情况和抓取需求变化。刚改完商品说明,先查这张页面最近一次已记录的抓取日期;需要追查某段时间的访问和错误,再看日志。Google 抓取需求说明

例如,你给蓝色衬衫的产品页补了尺码说明,想知道 Google 有没有读过新内容。你要查的是这张产品页,而不是全站昨天有多少爬虫请求。下面先教没有服务器权限的运营从哪里开始,再说明怎样请维护者用日志把情况查清楚。

先查一页:上次抓取是在修改前还是后

打开 Google Search Console,也就是 Google 的站长工具。选择这个网站的正确资源,在顶部检查栏粘贴完整产品页地址。网址必须属于当前资源,不能只填产品名或一段路径。

等结果出来,展开“网页索引编制”,找到抓取信息,记下上次抓取日期,再与这次修改时间比较。网址检查官方说明介绍了这里的抓取与索引信息。

假设你9月8日上午更新了尺码说明,报告仍记9月5日抓取。这个记录还不能说明 Google 已经看过8日的新稿。如果报告记了修改后的抓取,还要看是否成功;日期新,不等于内容一定被收录或会在某次搜索中显示。

“测试实际网址”可以辅助检查页面现在能不能访问,但它是你主动发起的检查,不是 Googlebot 自己回访。想了解过去两周来过几次、有没有间歇性报错,还是需要日志。日志就是服务器留下的访问记录,一行通常记录一次请求的时间、地址和结果。

如果只是正常小站的一张新页面,没有访问故障,先确认页面有站内入口、站点地图和正确索引设置,再观察后续记录。不必为了得到一个固定抓取周期搭一整套分析系统。Google 抓取统计说明也指出,小型网站通常无需担忧这类抓取细节。

需要查日志时,先把这几页和日期告诉维护者

挑出几张这次真正关心的页面,例如蓝衬衫产品页、尺码指南、产品分类和新服务页。给维护者每张的完整网址、最近修改时间,以及想查的起止日期。先从这一小批查,不用先导出全站再找问题。

可以这样说明:“请查9月1日至14日这四页的 Googlebot 访问,时间统一为北京时间,并告诉我日志有没有缺天。”服务器可能用 UTC 记时间,UTC 时间加8小时才是北京时间;保留原时间,再统一比较。比如 UTC 9月8日09:00,对应北京时间17:00,不能直接与当天10:00的修改时间比较。

还要问清日志来自哪里。CDN 是先替网站接收请求、再提供内容的服务;WAF 是拦截可疑访问的安全系统。请求在它们那里被挡住,原服务器可能完全看不到。这就是为什么只查原服务器的零记录,还不能说 Google 没来。

请维护者说明这批记录覆盖 CDN 还是原服务器,有没有缺失日期,以及能否取得真实客户端 IP。IP 是访问来源的网络地址;用了代理后,原服务器记录的可能只是代理地址。后面验证 Googlebot,需要正确的来源信息。

网址也先保留原样。旧地址、带参数地址和跳转后的地址分别记,不能一开始全改成你希望 Google 使用的地址。服务器实际收到哪条请求,才有可能查到对应行。抓取统计的计数规则也按实际请求地址统计跳转中的各次请求。

让维护者确认:这次访问真的是Googlebot吗

日志里写着“Googlebot”,还需要验证。这个名称来自 User-Agent,即访问者自报的程序名称;任何程序都可以用同样的字样。

维护者可以按 Google 验证请求的步骤,从来源 IP 反查主机名,再从该主机名查回 IP,确认符合对应的 Google 抓取类型。处理很多记录时,也可以匹配 Google 公布的相应 IP 范围。普通运营不用自己运行这些命令,要求结果区分“已确认”和“只有名称、未确认”即可。

人工检查要另外放。团队在站长工具点击实时测试,可能产生 Google-InspectionTool 请求;官方抓取工具说明说明它用于这类检查。不能把自己的测试也算成 Googlebot 自动来访。

最后限定请求的是网页本身。图片、CSS样式和脚本也会被请求,全站总数可能很大,却不能说明蓝衬衫页来过几次。请维护者筛目标网页的 HTML 请求;HEAD只查响应信息,GET取得内容,必要时也分开看。没有真实来源字段,先标“身份未确认”,不硬填一个看似精确的次数。

四张页面的结果,分别怎样处理

下面沿用四页、两周的教学记录,不是本站或客户日志。假设9月1日至14日的 CDN 和原服务器日志都齐全,以下次数只统计已确认的自动 Googlebot 网页请求。

这次关心的页面两周里看到了什么下一步
尺码指南 /guide/a/9月1日返回200,9月5日返回304,共2次确认它来过;若仍没收录,另查索引,而非继续找“没抓取”原因
产品分类 /category/b/9月7日、8日都返回500把时间和网址交主机维护者,查当时网页为什么出错
蓝衬衫产品页 /product/c/9月8日 CDN 记录403,原服务器无记录查当时的 CDN/WAF 安全规则,不以原服务器零行否定这次访问
新服务页 /service/d/完整两周两处都没看到匹配请求先确认上线日期、网址和站内入口,再继续观察

200表示服务器正常返回;304表示这次条件请求中,服务器回答内容未修改,也算发生过访问。500表示服务器出错,403表示拒绝访问。状态码回答服务器当时怎样回应,不回答 Google 最终是否收录。

尺码指南还有一条9月9日记录,只写 Googlebot 名称,没有核来源。它不能把“最近一次已确认访问”从5日改成9日。2次请求也不能据此推算以后每四天来一次。

对于分类页,先查同一时间其他页是否也500:全站都错,和只错一个模板,修法不同。维护者修好后,浏览器能打开说明现在正常;下一次自动 Googlebot 请求也正常,才说明新的这次抓取没有再遇到原错误。

蓝衬衫页的403要先看它本来是否应公开。如果本来要登录,拒绝访问可能符合安排;不要为了让爬虫进来取消业务权限。公开产品页被安全规则误拦,才针对那条规则处理。

新服务页若9月13日才发布,在这份日志里只有很短的等待时间。检查导航或相关页面能否点击到它,以及站点地图是否有正确地址,再观察。可按爬虫怎样发现页面补发现入口。没有记录不代表页面受罚,更不能直接推成抓取预算耗尽。

如果页面已正常被请求,却没有被收录,转到单页抓取与索引排查,检查 Google 选择的主要网址和内容问题。日志这一步已经回答“来过没有”,不应承担所有SEO诊断。

改完后,再看同一页的新请求

以蓝衬衫页为例,保留原403时间、修规则的日期和具体改动。先用公开浏览器访问确认当前页面恢复,再请维护者看后续真正的自动请求。新请求返回200,可写“这次访问已正常”;还没有新请求,就写“当前可访问,等待新的自动抓取”,不用一边等一边反复改标题。

GSC的抓取统计可以看全站趋势,不能替代这张逐页记录。报告包括图片等资源,也可能计入未到达站点日志的失败;示例网址又不是完整清单。因此全站总请求和你这四页的 HTML 次数不相等很正常。即便统一时间、主机和类型,报告仍可能与日志有差异,不把两边相减称作“漏抓”。Google 官方范围说明

最后给每页写一句读得懂的结果:“蓝衬衫页8日被安全规则拒绝,10日修复;当前能打开,后续自动请求待观察。”或“尺码指南两周内有2次已确认请求,索引问题继续另查。”记录要能指导下一步,而不是只剩一堆状态码。

如果重要页面长期遇到抓取、内容和站内入口问题,可以带着网站地址、两三个页面和你已查到的结果联系跨境YOUNG。先说明具体卡在哪,再判断哪些页面或技术项需要整理;咨询不代表保证某天收录。

常见问题

没有服务器或 CDN 日志,还能知道具体 URL 上次被抓的时间吗?

先在 Search Console 顶部输入完整网址,展开抓取信息,看它已记录的日期。它不是过去所有请求的清单;要查间歇错误或连续次数,还需向维护者要日志。拿不到时写明范围,不填“零次”。

日志显示304,算Googlebot抓取过吗?

确认身份和目标网页无误时,算一次请求。304是服务器对条件请求回答“未修改”,不是没有访问,也不证明页面已收录。新内容是否被处理,还要结合修改日和后续记录。

一张重要页两周没有已核Googlebot请求,应该马上提交收录吗?

先查日志齐不齐、有没有CDN拦截、网址是否变化和页面是否刚上线。再查站内入口、地图与网址检查状态。可以按具体问题请求重新抓取,但没有统一的“两周必须重抓”规则,也不能靠提交解决访问错误。

关于跨境YOUNG

跨境YOUNG整理WordPress建站、Google SEO与AI SEO / GEO方法,并提供建站、代运营和顾问服务。

需要有人持续推进SEO?

网站已上线,但页面、内容、技术、内链和月度数据没有持续推进?可先诊断范围与优先级,再按月执行与复盘。

最具性价比的服务器

Hostinger 适合预算有限的新站和中小企业 WordPress 网站,托管、备份与基础性能配置比较完整。通过专属链接可享 20% 折扣,购买前再核对机房位置和续费价格。

专属链接含 20% 折扣;跨境YOUNG可能获得佣金,不会增加你的购买成本。