网站规模扩大后,最不该继续手工做的是旧内容的批量处置:判断哪些页面退出、哪些保留、哪些合并。单个页面靠人工看还可以,一旦涉及成百上千个旧页面,手工操作既慢又容易前后矛盾。更可行的做法是先把旧内容整理成一份可执行清单,再交给系统按规则分批处理。
手工适合处理数量少、判断依赖上下文、一次性的决策。比如某篇旧文章是否还符合当前业务方向,这需要人来看。系统适合处理数量大、规则明确、需要重复执行的动作。比如把某批页面统一加上“已过时”标记,或者把指向旧页面的内链批量替换为新地址。
分界线可以这样判断:如果同一套判断逻辑要重复用几十次以上,就该考虑交给系统。如果每个页面都需要单独读一遍才能决定,那这部分仍然留给人。
一个实际动作是:先抽出二十个旧页面,手工走一遍退出或保留的判断,记录你实际用了哪些依据。这些依据就是后面写进系统的规则。如果这二十个页面里有一半以上无法用同一套依据判断,说明当前还不适合批量处理,应该先补充判断标准。
旧内容退出不等于直接删除。常见处理有三类,适用条件不同:
这三类的共同前提是:你已经知道每个旧页面当前还有没有外部链接、有没有访问、有没有被其他页面引用。缺少这些信息时,任何批量处理都可能是盲删。
一个可区分的证据是:如果某个旧页面在外部仍被引用,但站内已经没有任何入口,它更接近“保留但降级”而不是“下线”。反过来,如果站内站外都没有引用,访问也接近零,才更接近下线条件。访问量归零本身不能单独证明该页面无用,也可能是入口被撤后自然下降,需要结合引用情况一起看。
假设你手上有一份旧页面的地址列表,处理步骤可以这样展开:
这份清单本身就是可执行方案。它的价值在于:执行前你就能看到每一组的数量,判断批量操作会不会影响过大。如果下线组数量远超预期,应该先停下来复查判断依据,而不是直接执行。
批量处理完成后,重点不是马上看排名,而是看抓取和索引层面的变化。你可以观察旧地址是否还在被请求、合并后的新地址是否开始被访问、站内是否还有指向已下线地址的链接。
这里要区分环节:抓取、索引、排名是不同阶段。旧地址不再被抓取,只能说明入口和引用已经清理到位,不能直接说明处理正确。它也可能是站点整体抓取节奏变化导致的。要判断处理是否合理,需要把抓取变化和引用清理、访问迁移放在一起看。
如果发现仍有大量请求指向已下线地址,下一步应该是检查站内和外部引用是否清理干净,而不是急着恢复页面。如果合并后的新地址访问没有起色,下一步应该检查跳转是否生效、内链是否已更新。
系统处理的是规则,人处理的是例外。以下几类旧内容仍然适合手工决定:涉及品牌表述的页面、有法律或合规含义的页面、曾经是主要入口且外部引用复杂的页面。这些页面的处理结果影响面大,不适合完全交给批量规则。
一个折中做法是:系统负责筛选和标记,人负责最终确认。系统先把符合条件的旧页面挑出来并打上待处理标记,人工只复核这批标记结果。这样既减少了重复劳动,也保留了关键判断。
网站规模扩大后,真正需要放弃的不是手工本身,而是对手工重复劳动的依赖。把判断标准固定下来,把重复执行交给系统,旧内容的退出和保留才能保持一致。