跳到主内容

评分口径全公开:每一类分数是怎么算出来的

站点检测、品牌诊断、文章检测三类分数的完整计算公式与扣分明细,以及这些分数明确不做什么。口径与线上代码逐一对应,可手工复算。

2026-09-07 · 约 8 分钟读完

「AI 可见性评分」这个行业目前没有统一标准。同一个词在不同产品里可能是三件不同的事: 品牌被 AI 口头提到(mention)、回答里附上了你的链接(citation)、还是 AI 训练语料里存在你的内容。 口径不公开的分数没有比较价值,因此我们把自己每一类分数的完整计算过程写在这里—— 它与线上运行的代码逐一对应,你可以用任何一次检测报告里的原始数据手工复算出同样的分数。

站点检测总分 = 爬虫可达性 × 50% + AI 认知 × 50%

首页检测(域名报告页)的总分由两个子分各占一半构成,四舍五入取整:

  • 爬虫可达性分(0~100):从 100 分起扣。核心 AI 爬虫在 robots.txt 被屏蔽,每只扣 6 分 (此项最多扣 30 分);检测项未通过每条扣 20 分(UA 模拟访问类扣 15 分); 检测项为警告状态的,llms.txt 缺失扣 8 分、sitemap 缺失扣 6 分、其余每条扣 4 分,最低 0 分。
  • AI 认知分(0~100):向当前接入的全部 AI 平台逐一提问"你是否了解这个网站", 评审模型按应答内容分档——描述准确计 100、大致了解计 70、张冠李戴计 40、不认识计 10, 各平台取算术平均;提问失败的平台不参与平均,不拖低分数。

认知提问前会先做一轮联网检索,把检索到的本站页面注入提问上下文,模拟 AI 的联网应答状态; 检索失败时降级为纯参数知识提问。两种模式都会在报告里标注,因此同一域名在不同时点的认知分 可能因检索结果差异而小幅波动——这反映的是真实波动,不是口径变化。

品牌 GEO 得分 = 提及率 × 40% + 首推率 × 30% + 正向率 × 30%

品牌 GEO 诊断围绕一组固定问题向各平台提问,逐条回答统计三个比率后加权:

  • 提及率:回答了该问题的所有平台中,提到主品牌的回答占比。
  • 首推率:提到主品牌的回答中,将其列为第一个推荐的比例(以评审模型提取的品牌出现顺序为准)。
  • 正向率:提到主品牌的回答中,评审判定为正面态度的比例(中性不计入正向)。

得分对应四个阶段:0~24 为「不可见」、25~49 为「被提及」、50~74 为「被推荐」、75~100 为「被首推」。 监测功能启用后问题集会被固化(首次诊断时确定,之后巡检复用同一组问题), 保证分数趋势的变化只来自 AI 应答变化,不含问题集漂移的噪音——趋势可比性优先于问题集的适时更新。

文章 GEO 得分 = 问题覆盖率 × 70 + URL 引用率 × 30

文章检测先抓取正文、生成 10 个该文可回答的真实问题,再逐平台提问并做双口径判定: 评审文本判定该回答是否提及本文(覆盖率),代码从回答里提取链接判定是否附出本文 URL (引用率,同域其他页面计一半口径另行列示)。双口径分开列示的原因很简单: 被口头提到和被附链接是两种价值,混在一起会掩盖"叫好不叫座"(都提你但没人链你)的真实情况。

这些分数不做什么

  • 不做跨平台加权:各家 AI 平台按等权处理。我们没有可靠的各平台市场份额数据,引入拍脑袋权重只会制造虚假精确。
  • 不承诺绝对可比:分数设计目标是同一对象的趋势追踪与优化验证,横向对比两个不同行业站点的绝对分值意义有限。
  • 不把展示维度计入总分:联网检索命中、官网引用率、页面语义信号等在报告里单独展示但不参与计分,保持历史分数可回溯比较。
  • 不隐藏失败:平台提问失败、检索失败、数据库不可用时,报告与榜单按降级口径如实标注,不会用缓存或估算值填充。

AI 的回答本身存在采样随机性,单次检测的分值应理解为一次采样而非精确测量。 正确的用法是开启监测、固定问题集、按周观察趋势——单日 3~5 分的波动是正常噪音, 连续两周三同方向变化才是信号。这也是我们把"分数涨跌"而不是"分数绝对值"放在榜单与告警核心位置的原因。

本站检测项与本文方法保持一致,可用AI收录综合查询验证配置效果。各项结果仅供分析参考。

其他指南