GEO Visibility Benchmark

尚未完成首轮测试——方法与题库已定义,测量结果为空。

方法

固定题库在多个 AI 平台上重复测试,每次测试遵循以下规则:

  • 固定题库:每轮测试使用同一份题库版本(当前 v1)——同一实验的 Baseline 与 Retest 必须使用相同版本才可比较。
  • 全新对话:每个问题在无历史上下文的全新对话中提出,避免此前的追问污染结果。
  • 统一语言:题库为中文,保持提问语言一致。
  • 记录日期:每次提问记录 `askedAt` 时间戳。
  • 记录平台:记录具体平台(`platform_id`),如可见则记录模型版本(`model_name`,不作为固定字段追踪)。
  • 是否被提及 / 引用:分别记录 `mentioned`、`cited`,两者独立判定。
  • 实体 / 地域 / 项目准确性:对照 `expected_facts` 判定 `entity_correct`、`location_correct`、`project_correct`,三态(正确/有误/不适用),未被提及时记为"不适用"而非"有误"。
  • 原始回答存档:完整回答留存为内部记录(`raw_answer_reference`),公开页面只展示与判定相关的摘要,不逐字发布可能包含无关对话上下文的原文。

题库概览

分类题目数
实体身份10
项目关联10
泛化发现10
题库版本 v1 · 共 30 题(初始集,向 Phase 00 规划的 ~30 题规模扩展中)

测试平台

DEEPSEEK · DOUBAO · QIANWEN · YUANBAO · BING_COPILOT · BAIDU

最新一轮结果

说明

Baseline not measured yet —— 首轮基线测试尚未开始,不显示 0% 这类未经测量的数值。

核心指标

指标数值
Mention Rate尚未测量
Citation Rate尚未测量
First-party Citation Rate尚未测量
Entity Accuracy尚未测量
Project Association Accuracy尚未测量
Location Accuracy尚未测量
样本量:0 条记录。本站不发布单一综合 GEO 分数——不同维度的差异会被掩盖。

局限性

样本量小、AI 回答存在噪声、模型本身会持续更新——任何单轮结果都不构成统计显著结论。

Changelog

尚无历史测试记录。