当站点从几十个页面涨到几千个页面,最先该停掉的不是内容创作,而是那些依赖人工逐个确认的重复判断。飓风算法针对的是采集、拼接和低质聚合内容,而这类问题在规模扩大后恰好最容易批量出现。继续靠手工抽查,既追不上新增页面,也挡不住旧页面的批量风险。下面按“保留、改写、退出”三种取舍,说明哪些工作还值得手工做,哪些必须换成规则和抽样。
手工工作的失效,不是因为人做得不好,而是因为它的覆盖方式变了。小站时,你打开一个页面就能判断它是否属于采集或拼接;大站时,同样的判断需要重复几千次,而每次判断的依据并不完全一致。飓风算法应对的核心不是“更努力地检查”,而是让判断标准先固定下来,再决定哪些环节必须由人介入。
一个可操作的判断依据是:如果某个动作的结果,换一个人来做会得到基本相同的结论,那它就不适合继续手工做。反之,如果结论依赖页面与业务的真实关系、依赖编辑对行业语境的理解,那它仍值得保留人工。这个标准比“工作量大小”更可靠,因为它指向的是判断的稳定性,而不是数量。
这是规模扩大后第一个应该退出的动作。小站时逐页看还能接受,页面数量上来后,逐页确认会变成瓶颈,而且越到后面越容易漏掉批量生成的页面。更实际的做法是先建立可识别的特征,再让规则去圈定范围,人工只处理边界情况。
可用的特征包括:同一模板下正文段落高度重复、标题与正文主题错位、页面之间只有少量词被替换、同一批页面在同一时间段集中生成。假设一个站点有五千个页面,其中一批是围绕同一组关键词替换城市名生成的。先按模板和生成时间圈出这批页面,再抽样确认,比逐页打开要快得多,也能避免只看到前几十页就下结论。
这里要注意一个反常现象:抓取量或索引量突然归零,不能单独证明你的处理是对的。它也可能来自服务器波动、robots 规则调整或站点整体改版。把这些现象当作唯一证据,容易把一次误伤当成成功经验,下一步就会做错。
标题和摘要不适合完全交给模板,但也不适合全部手工重写。规模扩大后,合理的做法是把它们拆成两层:一层是可批量套用的结构,一层是需要人工确认的业务信息。结构层可以统一,业务信息层必须由了解产品的人来定。
适用前提是:页面本身有真实、独立的内容,只是标题写法过于接近。如果页面内容本身就是拼接的,改标题不会解决问题,这时应该退出的是页面本身,而不是标题。判断条件很简单——如果去掉标题后,两个页面的正文仍然高度相似,那问题在内容层,不在标题层。
一个实际动作是:先按模板相似度把页面分组,再对每组人工确认一到两个代表页面的标题写法,确认后回填到同组页面,最后抽查回填结果是否出现语义错位。这个动作的结果会直接影响下一步——如果抽查发现错位集中在某类页面,说明这类页面不该进入批量流程,应该单独处理或下架。
哪些页面该保留、该合并、该删除,不适合完全交给规则。规则能圈出候选范围,但最终决定依赖业务价值。比如一个页面流量不高,但它承载着品牌词或售后说明,删除它带来的损失不在 SEO 指标里。反过来,一个页面有抓取记录,但内容与站点主线无关,保留它只会稀释整体质量。
可行的分工是:规则负责圈出“疑似低质”的候选集,人工负责在候选集里做保留或退出。人工不必看全部页面,只需要看规则无法确定的那部分。这样既控制了工作量,也保留了必要的业务判断。
规则上线不等于问题解决。抽样验证是规模扩大后少数仍值得手工做的工作,因为它检验的是规则本身是否成立。抽样时不要只看规则命中的页面,也要看规则没有命中的页面,否则你只能确认规则在做什么,无法确认它漏了什么。
假设规则把“正文重复率超过某个阈值”的页面标记为待处理。抽样时如果只在被标记的页面里看,你会觉得规则很准;只有在未被标记的页面里也抽一部分,才能发现是否存在重复率不高但同样属于拼接的页面。这个动作的结果决定了下一步是收紧规则、放宽规则,还是承认规则无法覆盖某类情况,转回人工处理。
飓风算法应对在规模扩大后的重点,不是把手工工作做得更快,而是把不适合手工的判断换成可复核的规则,再把规则覆盖不到的部分留给人工。保留、改写还是退出,取决于页面内容是否独立、业务价值是否成立,而不取决于工作量本身。