🚀 OrcaScope 内测招募中 · 前 10 名设计伙伴免费 3 个月 立即报名 !
OrcaScope

公开实验

行业里关于「AI 答案有多不稳定」的说法大多来自二手引用。我们把它放到自己的生产数据上量了一遍——口径、样本量、以及哪些数我们不敢下结论,全部写在下面。

测量口径:263 条问法 · 8 个 AI 引擎 · 35 个采样日(最近一次 Thu Aug 06)。全部来自我们自己每晚跑批的生产数据,不是为写这页专门跑的一次性实验。品牌名与租户信息一律不出现——下面只有聚合数。

实验一 · 同一个问题,引擎之间有多不一致

n = 2,490

取「同一条问法 + 同一天 + 至少 4 个引擎都有结果」的样本,看这些引擎对同一个品牌是否给出一致的结论。只统计至少有一个引擎提到该品牌的 2,490 个样本——所有引擎都没提到的情况不构成"分歧"。

63.7%

当至少有一个 AI 引擎提到某个品牌时,其余引擎不同意的比例。

样本 2,490

这个数解释了一件在这个赛道里很常见的事:不同工具跑同一条 prompt 会给出不同答案。行业媒体 Digiday(2026-05)报道过买家的原话——「三个工具跑同一条 prompt,会得到三种不同的答案」。上面这个数说明分歧很大程度上不在工具,**在引擎本身**:引擎之间本来就不一致。所以「搜一次看一眼」得到的是一个引擎在某一刻的样本,不是你的可见度。

实验二 · 昨天被提到的品牌,今天还在吗

n = 50,647

固定住问法与引擎,只让日期变动,比较相邻两天的结论。共 50,647 组相邻两天的可比对。

15.6%
昨天提了,今天不提

在昨天被提到的那些样本里

5.2%
隔天结论翻转(两个方向合计)

在全部 50,647 组比对里

左边那个数是这页最有用的一个:问法没改、引擎没换、只过了一天,昨天还被提到的样本里有 15.6% 今天就消失了。这不是"你的排名掉了",这是**基线本身在抖**。⇒ 任何单次测量都不构成结论;判断一次优化有没有效,必须看足够长的窗口,并且和一个没被优化的对照组比——否则你八成是在给噪声记功。

这页不打算下的结论

不能说「哪个引擎更准」。分歧只说明它们不一致,没有哪一份答案是标准答案——我们手上没有 ground truth。

不能外推到整个互联网。样本来自我们客户实际在监测的问法,行业与语种分布都不是随机的。

不能把翻转全归给引擎。检测本身也有误差,我们只统计检测已完成的格,但没有为此单独做人工复核。

上面的数会随每晚跑批自动更新——这页没有手写的数字,改口径只能改数据库里那个公开函数。 看完整方法论