根据站内搜索发现需求,核心做法是先把站内搜索产生的查询词导出来,再按“用户原话、出现次数、结果页点击与空结果”分组,最后用这些分组去决定内容采集和补充的顺序。人手有限时,最先处理的不是词量最大的那组,而是“有人反复搜、站内却没有对应内容”的那组。
站内搜索通常会在后台留下查询记录,也可能通过搜索日志、分析工具的事件或搜索接口日志获得。无论来源是哪一种,先做三件事:
这里最关键的是“结果数量”这一列。它比查询次数更能说明缺口:同一个词被搜十次、每次都返回大量结果,可能只是入口不好找;被搜三次却返回零结果,才是明确的内容缺口。
整理完清单后,按下面三个信号排序,而不是按词频排序:
举个假设例子:假设站内搜索记录里,“A 和 B 的区别”出现 12 次,结果页返回 0 条;而“A 介绍”出现 40 次,结果页返回 30 条且有稳定点击。此时应先处理“A 和 B 的区别”,因为它是缺口,而不是因为它次数更多。
判断适用条件时要注意:如果某个查询词只出现一两次,且与你的站点主题无关,可以暂时跳过;如果它反复出现、又和已有内容体系相关,就值得进入采集清单。
站内搜索只能证明“站内有人这样搜”,不能直接证明外部也有同样需求。验证时做两件事:
验证通过后,再决定采集规模。一个查询词对应一个明确问题,就先做一篇能完整回答的内容;一组同义查询对应同一意图,就合并成一个主题,用不同小节覆盖不同说法。不要为了覆盖更多词而把同一内容拆成多篇。
站内搜索不是一次性任务。建议每月做一次简短复查:
时间和人手有限时,把维护频率定在你能坚持的范围内,比一次做很全更重要。每次只处理零结果和低点击这两类,通常就能覆盖最明显的缺口。
下一步可以直接从站内搜索后台导出最近一段时间的查询记录,先标出结果数为零的词,再按出现次数从高到低排列,从中挑出第一个要补的主题。