GEO Visibility Benchmark
尚未完成首轮测试——方法与题库已定义,测量结果为空。
方法
固定题库在多个 AI 平台上重复测试,每次测试遵循以下规则:
- 固定题库:每轮测试使用同一份题库版本(当前 v1)——同一实验的 Baseline 与 Retest 必须使用相同版本才可比较。
- 全新对话:每个问题在无历史上下文的全新对话中提出,避免此前的追问污染结果。
- 统一语言:题库为中文,保持提问语言一致。
- 记录日期:每次提问记录 `askedAt` 时间戳。
- 记录平台:记录具体平台(`platform_id`),如可见则记录模型版本(`model_name`,不作为固定字段追踪)。
- 是否被提及 / 引用:分别记录 `mentioned`、`cited`,两者独立判定。
- 实体 / 地域 / 项目准确性:对照 `expected_facts` 判定 `entity_correct`、`location_correct`、`project_correct`,三态(正确/有误/不适用),未被提及时记为"不适用"而非"有误"。
- 原始回答存档:完整回答留存为内部记录(`raw_answer_reference`),公开页面只展示与判定相关的摘要,不逐字发布可能包含无关对话上下文的原文。
题库概览
| 分类 | 题目数 |
|---|---|
| 实体身份 | 10 |
| 项目关联 | 10 |
| 泛化发现 | 10 |
测试平台
DEEPSEEK · DOUBAO · QIANWEN · YUANBAO · BING_COPILOT · BAIDU
最新一轮结果
说明
Baseline not measured yet —— 首轮基线测试尚未开始,不显示 0% 这类未经测量的数值。
核心指标
| 指标 | 数值 |
|---|---|
| Mention Rate | 尚未测量 |
| Citation Rate | 尚未测量 |
| First-party Citation Rate | 尚未测量 |
| Entity Accuracy | 尚未测量 |
| Project Association Accuracy | 尚未测量 |
| Location Accuracy | 尚未测量 |
局限性
样本量小、AI 回答存在噪声、模型本身会持续更新——任何单轮结果都不构成统计显著结论。
Changelog
尚无历史测试记录。