产品聚合页上有材质、尺寸、用途和排序按钮时,用户能更快找到产品;这些控件也会生成大量 URL。筛选页 SEO 的第一步是给每类 URL 写明目标:作为独立搜索入口、只让当前用户临时筛选,还是表示无效组合。目标不同,抓取、索引、canonical 和 HTTP 状态也不同。普通分类分页是内容序列,不能顺手套进“拦截筛选参数”的规则。
下面的 https://example.com/pumps/ 及所有商品状态都是教学示例。母聚合页如何帮助采购者选产品,可先看网站架构;本文只处理筛选衍生 URL 的规则。
把筛选 URL 列出来,才能看到规模
先从页面模板、渲染后的筛选链接、服务器日志和 Search Console 各取样,而不是只看 sitemap。记录每条 URL 的参数、返回码、商品数、meta robots、canonical、内部链接来源与是否已索引。一个控件有 3 种材质、4 种用途、5 个流量段和 3 种排序,理论组合可到 180 种;这个乘法只说明规模风险,不等于 180 张都存在或都被 Google 抓取。
样本要包括一张母页、一个可能值得独立承接的组合、一个排序 URL、一个真正无结果 URL,以及正常 ?page=2。参数顺序、重复参数和值非法的 URL 另记;这类不是新的采购任务。Google 的分面导航抓取文档指出,组合 URL 可形成很大的抓取空间,影响新内容发现,所以应按 URL 模式制定规则。
给每类组合定一个有意图的状态
以下表格是设计预期,需用真实库存、目标市场 SERP 和当前索引状态核实后才能在生产站实施。“食品级不锈钢泵”只是候选名称,不表示示例产品具有食品接触认证。
| URL 教学样本 | 想让 Google 做什么 | 页面/规则与可观察结果 |
|---|---|---|
/pumps/ | 抓取并可能索引母集合 | 200;可见产品链接;自指 canonical;不被 robots 阻挡 |
/pumps/food-grade-steel/ | 证据齐全后作为少量独立子集合 | 200;稳定产品和不同选型内容;自指 canonical;母页有 a href 入口。核实前保留为候选,不宣称已开放 |
/pumps/?sort=price-desc | 供用户排序,不当独立搜索入口 | 同一商品集合只变顺序。若未索引且组合量大,可按精确模式限制抓取;若已索引,先允许抓取并输出 noindex,读回后再评估抓取控制 |
/pumps/?material=glass&use=food | 真正不存在的无效组合 | 在原 URL 返回 404,页面可提示调整筛选;不跳到首页,不输出空白 200 |
/pumps/?page=2 | 让第二段真实商品和链接可达 | 200、第二段商品、指向下一页/详情的 href、自指 canonical;不得被筛选参数规则误挡 |
这个矩阵先决定结果,再写配置。对于可开放的子集合,必须核实际商品、独立查询需求和区别于母页的帮助;否则仅有好看的 slug 也不构成新页面。类目与商品的链接关系由 Google 的电商站结构指南支持,具体商品事实仍靠企业数据。
抓取、索引和规范化不能混作一个开关
robots.txt 的 Disallow 是“不要抓取”;noindex 是“抓到页面后不要索引”;canonical 是“这里有更合适的规范 URL”信号。若 Google 已被 robots 阻止取回排序页,它也看不到页内的 <meta name="robots" content="noindex">。因此对已索引排序 URL,先保持可抓取、输出 noindex,并在 Search Console 读回状态;仅在确认不再需要通过页面传递移除指令、且确有大规模抓取问题时,再讨论阻止相应参数模式。这个顺序不保证即时移除。
对新产生且从未打算做搜索入口的大量排序组合,可评估 robots 模式。示例只针对 /pumps/ 下的 sort 参数,不能写成 Disallow: /pumps/?,后者也可能挡住正常 ?page=2。参数可能出现在首位或后位;开发必须对两种顺序及 URL 编码实测,不凭一条通配规则推全站。规则匹配法另见本站robots.txt 指南。
canonical 适合表达重复变体的首选地址,却不会像开关一样停止抓取或保证移除索引。候选子集合若确实有独立产品与选型内容,不应机械 canonical 到母页。需要配置标签时参考本站canonical 指南;先决定内容关系,再决定标签。
零结果、缺货与重复参数分开处理
真正不可能的组合,例如教学目录根本没有“玻璃材质食品泵”,应在请求的原 URL 返回 404。Google 的分面导航文档也把重复筛选、无意义组合和不存在的分页列入 404 情况。页面仍可给用户返回母集合或移除某个条件的链接;不要为了“有页面”把无结果改成 200。
短期售罄是另一回事:产品族和用途可能仍有效,需看替代品、补货计划及买家任务,再决定保留说明、下架链接或调整页面。参数顺序不同但商品集合相同,应在系统中产生一种稳定顺序,并减少重复入口;不能把两种顺序包装成两张独立子类目。若某个子集合长期没有可售品且无替代,应重评它是否还值得开放。
先用一组 URL 测试,再扩大规则
选母页、一个拟开放组合、一个仅排序组合、一个零结果组合和正常分页 ?page=2,上线前后都在未登录环境记录:HTTP 状态、robots 是否允许请求、原始/渲染 HTML 的 meta robots 与 canonical、页面产品和 a href。这五条的设计验收结果分别是“母页可访问”“开放页有真实商品与自指 canonical”“排序页按其当前阶段受控”“真无结果 404”“page=2 仍有第二段与详情链接”。任何一项与目标相反,都不能放行全站规则。

再在 Search Console 对已索引排序样本看 Google 读取到的索引指令,对候选子集合核 Google 选定的规范 URL;抓取日志用于观察参数请求量。若 ?page=2 被挡、商品详情丢链接或开放子集合被误匹配,先撤回该模式并修规则,不要只为消除索引报告数字而把所有参数封闭。没有目标站日志与 GSC,就只能把这张表作为待执行的验收单,不能写“处理完成”。
常见问题
所有筛选页 canonical 到母页行不行?
不行一刀切。排序变体与具有独立选择价值的稳定子集合,内容关系不同。canonical 也不是抓取控制或强制删索引命令。
robots.txt 与 noindex 同时配置能双保险吗?
若 robots 阻止抓取,Google 无法读取该页的 noindex。先确认目标是减少请求还是让已索引 URL 退出搜索。
零结果直接跳首页可以吗?
真正无效组合在原 URL 返回 404,并给可操作的筛选调整入口;跳无关首页会丢失用户原本的条件。短期售罄要单独判断。