方法论

可审计的公式、Core-3 引擎口径,以及 Citebench Index 的版本规则。

Citebench 方法论 v0.1

目的

Citebench 用冻结、可版本化的问题池,按榜单测量品牌在 AI 答案引擎中的可见度。它是测量标准,不是内容生成器。

榜单

Index 按榜单计算(一个品类 + 冻结题池)。跨榜的分数不可直接比较

AI 学习ai-learning)— 公开 MVP 主榜

CS 学习cs-learning)— Beta / 并行试跑

SaaS 与电商榜在题池冻结后开放。

Core-3 引擎

Index 对当周成功返回答案的引擎等权平均(Perplexity、ChatGPT Search,以及可选的 Google AI Overviews)。若某引擎关闭或降级,UI 标记该周为 degraded,并对其余引擎取平均。

指标

Brand Mention Rate(品牌提及率)

对实体 E 与 Core 题集 Q:

MentionRate(E) = |{ q in Q : 答案文本出现 E 的品牌名或别名 }| / |Q|

• 大小写不敏感

• 每个品牌有经审核的正式名与别名列表

• 禁止危险短别名(如 TOP

Citation Attribution Rate(引用归属率)

CitationRate(E) = |{ q in Q : 至少一条引用 URL 的 host 命中 E 的域名 }| / |Q|

• host 等于品牌域名,或为其子域

Kaggle Learn 使用 kaggle.com——竞赛页可能抬高引用,v0.1 视为已知噪声

GEO Visibility Index

单引擎:

Index_engine(E) = 0.4 × MentionRate_engine(E) + 0.6 × CitationRate_engine(E)

Core-3 合成(仅成功引擎等权):

Index(E) = mean(Index_engine(E))

比率与 Index 落在 [0, 1](界面可显示为 %)。

共享品牌

Coursera 同时出现在 AI 学习与 CS 学习,使用相同域名与别名。打分始终在单一榜单题池内进行。

版本

• 周跑不得就地修改冻结题干

• 题池变更需提升版本并写入变更说明

• v0.1 约 31 道 Core 题用于 pilot;公开权威 freeze 目标为 v0.2+(≥80 题)

审计

每条 (engine, query_id, run) 保存原文哈希、解析器版本与适配器版本,便于审计已发布周次,而无需暴露内部实现路径。