文旅GEO实验并不需要把所有可见现象都压成复杂评分。指标越多,越容易出现重复计分、分母不一致和读者无法解释的问题。一个实用的最小指标集,应覆盖答案中的事实主张、来源证据、任务完整性、时间适用性和重复稳定性,同时保留缺失与失败。指标数量少不等于证据简单,关键是每个数字都能回到原始样本。
主张支持率看事实与证据

先拆出可核验主张,再分别记录事实状态和来源支持状态。报告分子、分母、排除规则与无法判断数量。不要把一句话拆成许多无意义片段来提高比例,也不要把整篇答案一次判定掩盖局部错误。
实际执行时记录查询原文、版本、时间、入口、地区、样本状态与证据位置;未采集不得猜测补零。
引用准确率看链接是否匹配

引用准确率应检查链接可访问、对象一致、时间适用和内容是否真正支持主张。只有链接存在但不匹配时,记录为引用不支持而非成功。首页、搜索结果和重定向要有明确分类。
实际执行时记录查询原文、版本、时间、入口、地区、样本状态与证据位置;未采集不得猜测补零。
完整性看必要条件覆盖
为每类任务预先列出必要字段或问题条件,按覆盖情况记录。没有必要条件清单时不要临时打分。完整性与答案长度分离,长答案遗漏关键限制时仍可能不完整。
实际执行时记录查询原文、版本、时间、入口、地区、样本状态与证据位置;未采集不得猜测补零。
时效通过率看可用窗口

按主张适用窗口判断来源是否仍可用,记录过期、未知和冲突。日期不明不能当作通过,也不能直接当作失败;必须保留未知原因和后续复核条件。
实际执行时记录查询原文、版本、时间、入口、地区、样本状态与证据位置;未采集不得猜测补零。
稳定性与缺失率必须并列
重复查询的结果范围、失败次数和缺失原因反映系统波动。缺失率不是质量总分的反面,拒答和无法采集要分开。最小指标集应附样本表、版本、环境和计算公式。
实际执行时记录查询原文、版本、时间、入口、地区、样本状态与证据位置;未采集不得猜测补零。
一份最小记录模板
每条样本至少保存实验编号、查询集版本、问题原文、目标实体、语言、地区、设备或入口条件、会话状态、完整可见输出、来源链接、主张拆分、判定规则、复核状态、失败原因和限制。原始输出与分析结论分开保存;规则变化建立新版本,不能用新规则覆盖旧结果。涉及时间敏感事实时,同时记录来源日期、采集日期、适用窗口和失效条件。
结语
可比性不是把不同答案压成一个漂亮数字,而是让评价对象、证据、分母、时间和入口条件彼此对应。把缺失、失败和无法判断留在结果里,结论才不会超出真实样本。
