跳到主内容

AI爬虫日志分析

把服务器访问日志贴进来,逐行匹配 39 只主流 AI 爬虫的 UA,按爬虫聚合访问量、抓取路径与状态码。日志只在你本次请求内处理,不写入数据库。

支持 Nginx / Apache combined 格式 access.log

工具简介

AI 爬虫的实际抓取情况无法从搜索引擎后台获取,只能由站长从服务器访问日志中自行统计。本工具解析 Nginx / Apache combined 格式的 access.log,按 User-Agent 与「AI爬虫UA大全」中的 39 只爬虫 token 逐行匹配,输出每只爬虫的访问量、首次/最近访问时间、HTTP 状态分布与被抓取最多的路径;UA 中含 bot、crawler、spider 等特征但未收录的访问会单列为「疑似其他爬虫」,便于发现新出现的 AI 爬虫。

爬虫抓取之外,工具同时按 Referer 识别「AI 引荐流量」:用户在 ChatGPT、Perplexity、豆包、DeepSeek、Kimi 等 AI 平台的回答中点开链接来到你的网站时,浏览器会带上该平台域名的 Referer。这部分是 AI 已经为你带来的真实访客,按来源平台与被访页面汇总——爬虫访问量回答「AI 是否在读你」,引荐流量回答「AI 是否已为你带来用户」,两者对照可直接衡量 GEO 的产出效果。

分析在你的本次请求内完成,日志内容不会写入数据库。单次最多处理 3MB 文本(约 5 万行),日志量较大时建议先用 grep 过滤或截取典型时间段。状态分布中出现大量 4xx/5xx 通常意味着爬虫抓取受阻,可能与防火墙规则或站点错误有关。

各项结果仅供分析参考。

相关工具