AI 搜索基线测试题库模板(可直接复制)
想知道 AI 现在怎么回答和你有关的问题,需要一份固定的题库,并且每次都用同样的方式提问、同样的方式记录。这是一份可以直接用的模板,方法和本站自己做的 DeepSeek 基线测试一致。
先说边界
这是一个简单的手工方法:文本匹配 + 人工记录,没有综合评分,也不能证明因果。本站自己的基线只测了 DeepSeek 一个平台、只跑了一次,见 测试记录。
题库怎么设计
10–20 条够用。先写问题,再想“期望被引用的页面”。
| 类型 | 句式 | 例子 | 测的是什么 |
|---|---|---|---|
| 商业型 | [城市][服务] | 郑州GEO优化 | 想找服务商的人会怎么搜 |
| 商业型 | [城市][服务]哪家靠谱 | (把你的行业代入) | 带比较意图,AI 更可能给出名单 |
| 问题型 | [城市]企业怎么[做某件事] | 郑州企业怎么让AI搜索到 | 想自己解决问题的人会怎么问 |
| 问题型 | [做某事]怎么办 | AI搜索搜不到怎么办 | 带痛点,回答里更可能引用文章 |
| 品牌型 | [企业名]是做什么的 | (代入你的企业名) | 测实体有没有被理解,不是测获客 |
建议商业型和问题型各写一半,品牌型最多 2–3 条。不要只测品牌型:它回答的是“AI 认不认识你”,不是“陌生客户能不能找到你”。
每条怎么提问
- 选一个平台的网页版,记下是否登录、是否开启联网搜索。
- 每条新开一个会话,把题库里的原文粘贴进去,不做任何补充。
- 等回答结束后,展开来源列表(如果有),一并保存。
- 保存完整回答和截图,按题号命名。
- 按下面的字段填写表格,只记是 / 否和对 / 错,不打分。
要记录哪些字段
| 字段 | 怎么填 |
|---|---|
| id | 题号,固定后不再改 |
| query | 原文,一个字都不要改 |
| type | 商业 / 问题 / 品牌 |
| expected_page | 你希望被引用的页面 |
| date / platform | 测试日期、平台、是否登录 |
| mention | 回答里是否提到你的企业(是 / 否) |
| domain_cited | 来源里是否出现你的官网域名(是 / 否) |
| target_cited | 来源里是否出现 expected_page(是 / 否) |
| facts_correct | 如果提到了:名称、地区、业务是否正确(对 / 部分 / 错 / 不适用) |
| top_sources | 来源里出现最多的 3 个域名 |
| raw_path | 完整回答与截图的存档位置 |
可复制的 CSV 模板
复制后粘贴到文本文件,保存为 .csv,用表格软件打开。第一行是示例。
id,query,type,expected_page,date,platform,mention,domain_cited,target_cited,facts_correct,top_sources,raw_path
Q01,郑州GEO优化,商业,/service/,2026-10-04,DeepSeek网页版,否,否,否,不适用,,evidence/Q01
Q02,,,,,,,,,,,
Q03,,,,,,,,,,,5 个容易踩的坑
- 问题只写自己人才会问的话。“某某公司怎么样”只有熟悉你的人才会问。客户在不认识你时会问的,是行业词、地域词和问题型句子。
- 测完之后改措辞。改了措辞就是新题,不能再和上一次对比。真想改,另存为新版本,重新测。
- 在同一个对话里连续问。上一条的上下文会影响下一条。每条都要新开会话。
- 只存结论,不存原始回答。之后想复核、想重新分类,都需要完整回答、来源列表和截图。
- 只测一次就下结论。AI 的回答每次可能不同。一次结果只能说明“那一次发生了什么”。有条件的话,重要的题多问几次,并分别记录。
测完之后
先看是哪一种情况:没被发现、被说错了,还是没有可引用的来源,再决定改什么,参见 8 项自查清单 和 企业信息一致性检查表。改完之后,用同一份题库、同样的方式再测一次,把两次结果放在一起看。
本站自己的题库和逐条结果公开在 GEO 实验室;如果想让我帮你做这件事,见 企业 GEO 优化服务。