处理机器人或内部访问干扰,第一步不是删数据,而是先给访问打上来源标记,把疑似机器人和内部访问单独分层,再对比剔除前后的指标差异。如果剔除后核心指标变化很小,说明干扰有限;如果变化明显,才需要进一步调整过滤规则和分析口径。这个顺序能避免误删真实用户数据,也能让后续判断有据可查。
机器人或内部访问通常通过几种迹象暴露:同一IP短时间高频请求、User-Agent异常集中、访问路径高度重复、停留时间极短、页面深度几乎为零、转化事件与流量量级明显不匹配。内部访问还可能表现为固定办公网段、公司设备标识或测试账号反复出现。
这里要区分“可能原因”和“已经定位的原因”。上述迹象只能说明存在异常嫌疑,不能直接断定就是机器人。比如高跳出率也可能来自落地页与广告承诺不符,短停留也可能来自页面加载失败。判断时至少交叉两项证据,再决定是否标记。
更稳妥的做法是保留原始数据,新增一个标记字段。常见分层方式:
internal:公司网段、测试设备、已知监控工具。suspected_bot:高频、异常UA、无交互行为。clean:未命中上述规则的访问。在站内统计、搜索引擎报告和第三方估算之间,口径本来就不一致。第三方估算常基于抽样和模型,站内统计基于实际埋点,搜索引擎报告只覆盖自身来源。做对比时要固定同一时间范围、同一指标定义,否则差异会被误读为干扰。
假设某页面全部访问的转化率为2%,剔除内部访问后为1.8%,再剔除疑似机器人后仍为1.8%,说明内部访问对结论影响较大,机器人影响较小。这只是假设示例,实际数值要以自己的数据为准。
处理完成后,看三个信号:一是核心指标在剔除前后是否稳定;二是被标记的访问是否集中在少数IP或UA;三是过滤规则是否误伤了有真实交互的访问。如果剔除后指标波动很小,可以维持现有口径;如果波动大且异常集中在特定来源,应把过滤规则固化到日常报表中,并定期复核。
适用条件上,内部访问干扰明显时优先处理内部标记;机器人占比高且行为特征稳定时,优先完善机器人识别规则。两者同时存在时,先分层再比较,不要一次性全部剔除。
先建立一份内部访问与疑似机器人的标记清单,用最近一个完整周期的数据跑一次三组对比,把差异最大的指标和页面记下来,作为下一轮分析口径调整的依据。