判断舆情监控系统是否遗漏,不能只看系统里有没有出现某条信息,而要先定义“应该采到什么”,再用独立样本反查。核心方法是:先建立覆盖基线,再从站外或人工渠道抽取已知内容,回系统检索比对,最后按来源、时间、关键词三条线索定位漏点。没有基线,任何“感觉漏了”都无法验证。
采集遗漏至少分三种,判断方式不同:
先区分属于哪一类,再决定查配置、查抓取日志还是查检索规则。三类混在一起排查,容易把配置问题误判成技术故障。
基线就是一份“已知存在的内容清单”,用来和系统结果对照。可按以下步骤执行:
如果未命中集中在同一来源,优先查接入配置;如果集中在同一时间段,查抓取任务是否中断;如果集中在不含明显关键词的内容,查匹配规则是否过严。
全量核对成本高,实际诊断常用分层抽样。按来源类型分层:门户、社交平台、论坛、评论区各抽若干条。每层抽10到20条已知内容,回系统检索。
判断结果时注意:
抽样只能说明“这一层可能有问题”,不能直接证明全量遗漏比例。要确认范围,需扩大样本或对该来源做一次完整对照。
内容发布后短时间内没出现在系统里,不一定是遗漏,可能是采集周期未到。判断方法是:记录内容发布时间,等待一个完整采集周期后再次检索。若超过合理周期仍无结果,才按遗漏处理。
合理周期取决于来源更新频率和系统配置,没有统一标准。可先观察同一来源正常内容的平均入库间隔,再以此作为参照。如果某条内容明显超出该间隔,且同来源其他内容正常,则更可能是单条抓取失败,而非整体遗漏。
确认遗漏后,按“来源配置—抓取日志—解析规则—检索匹配”的顺序逐层排查。先修影响面最大的那一层,再重新抽样验证。若无法直接查看抓取日志,可先用同一来源的新内容做小样本对照,观察修复后命中情况是否改善。不要一次调整多个环节,否则无法判断哪一步起了作用。