Citebench 方法论 v0.1
目的
Citebench 用冻结、可版本化的问题池,按榜单测量品牌在 AI 答案引擎中的可见度。它是测量标准,不是内容生成器。
榜单
Index 按榜单计算(一个品类 + 冻结题池)。跨榜的分数不可直接比较。
• AI 学习(ai-learning)— 公开 MVP 主榜
• CS 学习(cs-learning)— Beta / 并行试跑
SaaS 与电商榜在题池冻结后开放。
Core-3 引擎
Index 对当周成功返回答案的引擎等权平均(Perplexity、ChatGPT Search,以及可选的 Google AI Overviews)。若某引擎关闭或降级,UI 标记该周为 degraded,并对其余引擎取平均。
指标
Brand Mention Rate(品牌提及率)
对实体 E 与 Core 题集 Q:
MentionRate(E) = |{ q in Q : 答案文本出现 E 的品牌名或别名 }| / |Q|
• 大小写不敏感
• 每个品牌有经审核的正式名与别名列表
• 禁止危险短别名(如 TOP)
Citation Attribution Rate(引用归属率)
CitationRate(E) = |{ q in Q : 至少一条引用 URL 的 host 命中 E 的域名 }| / |Q|
• host 等于品牌域名,或为其子域
• Kaggle Learn 使用 kaggle.com——竞赛页可能抬高引用,v0.1 视为已知噪声
GEO Visibility Index
单引擎:
Index_engine(E) = 0.4 × MentionRate_engine(E) + 0.6 × CitationRate_engine(E)
Core-3 合成(仅成功引擎等权):
Index(E) = mean(Index_engine(E))
比率与 Index 落在 [0, 1](界面可显示为 %)。
共享品牌
Coursera 同时出现在 AI 学习与 CS 学习,使用相同域名与别名。打分始终在单一榜单题池内进行。
版本
• 周跑不得就地修改冻结题干
• 题池变更需提升版本并写入变更说明
• v0.1 约 31 道 Core 题用于 pilot;公开权威 freeze 目标为 v0.2+(≥80 题)
审计
每条 (engine, query_id, run) 保存原文哈希、解析器版本与适配器版本,便于审计已发布周次,而无需暴露内部实现路径。