仪表盘上那个 0–100 的大数字是怎么来的?这篇是「人话版」。逐条口径的规范全文在方法论页——两边如有出入,以方法论页为准。
从一个问题到一个分数,六步
- 监测问题:每个品牌配一批监测问题——买家真的会问 AI 的那种,比如「XX 行业哪几家值得选」。
- 持续采样:我们的 worker 定期把这批问题发给每个已接入引擎(截至本文更新共 8 个:ChatGPT、Kimi、DeepSeek、Gemini、豆包、通义千问、Perplexity、Grok),记录完整回答。
- 提及判定:检查回答正文是否出现品牌名(含常见别名)。当前版本不做语气/情感判断——提及就是提及,这是刻意的克制;语气分析在后续迭代计划里。
- 引用解析:部分引擎会在回答末尾附参考来源链接(如 Kimi 的 references),我们解析并按域名计数——「AI 认为谁权威」是内容策略最值钱的线索之一。
- 标准化:把每个引擎下的提及情况标准化成 0–100 的引擎子分。
- 综合分:各已接入引擎子分的加权平均;某引擎本批次样本不足时动态调低其权重,防止小样本噪声污染综合分。
三个诚实设计
- 数据不足就明说。样本不够时,界面直接标「数据不足」,不假装精确。
- 评分版本化。口径迭代会升级评分版本(score_version),历史批次带版本标签——趋势对比永远在同一口径内进行。
- 口径全文公开。行业媒体 Digiday(2026-05)报道过买家的抱怨:「三个工具跑同一条 prompt,会得到三种不同的答案。」当全赛道的测量口径都是黑盒时,分数只是在猜。我们把口径全部摊开,是刻意选择的白帽路线。
我们不做什么
不刷量(不重复发同一条问题人为拉高提及率)、不做提示注入、不投喂污染内容、不编造评价。分数的意义在于指导决策——被操纵的分数一文不值。