查看你公司的 AI 可见度
免费,无需信用卡。
AI 推荐贵公司,但补充说明某个产品功能在每个计划中都可用。链接指向一个真实页面。然而,当你打开它时,该功能只在特定套餐中可用。贵公司获得了提及和引用,但客户却收到了错误的承诺。
这需要对特定声明进行评估,而不是对来源计数器进行评估。本文探讨了答案是否与其引用的材料一致。它既不是通用可见度指南,也不是对模型错误率的研究。示例是假设性的。源文档检查日期为 2026 年 10 月 5 日。
将事实准确性与引用正确性分开
问两个问题:“在被评估的条件下,该信息是否真实?”以及“引用的材料是否确实支持它?”一个陈述可能是真实的,但其引用可能有误。来源也可能支持已过时的信息,而这些信息不再描述当前的产品。
在 使大型语言模型生成带引用的文本,研究人员区分了答案正确性与引用质量。我们使用这一区别,但不将他们 2023 年的实验结果推广到当前产品中。
也要记录链接的作用。句子旁的引用、综合来源列表和“相关”资源可能有不同的含义。 Gemini Apps 文档 解释称该应用可能显示来源或相关内容,并非每个答案都包含此类链接。不要自动将整个列表分配给每个句子。
选择对客户重要的声明
从客户可能用于决策的信息开始:功能范围、计划条件、兼容性、市场可用性或实施要求。一个通用判断如“方便的工具”需要与可验证的事实(如集成)不同的标准。
将包含多个承诺的句子拆分为独立声明。例如,“该产品支持集成并保证在 24 小时内回复支持”包含两项需要核查的内容。否则,正确的部分可能会掩盖错误的部分。
定义审核的边界:问题、AI 产品、模式、语言、市场和时间段。保留原始问题、完整答案和日期。在之后询问来源会改变对话;将该结果保存为后续步骤,而不是原始答案的来源。将 API 结果标记为 API 结果,而不将其等同于面向用户的应用程序。
建立声明和证据记录
评估单位是一个声明及其分配的来源。如果多个链接共同支持该陈述,则评估它们的综合内容并保留所有 URL。更多的引用并不意味着更多的评估声明。
- 上下文:问题、AI 产品、模式、语言、市场和答案日期。
- 声明:确切的措辞以及适用的条件。
- 归属:分配的网址及其与句子的关联方式。
- 证据:简短的来源摘录、其在页面中的位置和检索日期。
- 现状:官方材料,描述当前状况及其所有者。
- 评估:来源支持、上下文中的事实准确性及推理。
- 下一步:优先级、负责人、更正和重新检查方法。
阅读内容,而不仅仅是页面标题或搜索摘要。检查产品名称、版本、市场、计划和资格。如果您无法可靠地将综合来源列表与句子联系起来,请记录不确定的归属,而不是编造证据。
使用明确规则评估来源
这些标签是您自己审计的建议。它们既不是Semly指标,也不是AI提供商使用的官方标准。评估完整的声明及其材料条件。
| 引用评估 | 何时使用 | 记录内容 |
|---|---|---|
| 支持 | 分配的材料在评估的上下文中支持整个声明。 | 支持该事实及其条件的段落。 |
| 部分支持 | 它们支持声明的一部分,但不支持其全部范围或一个重要条件。 | 支持的内容和缺失的内容。 |
| 矛盾 | 引用的来源提供的信息与声明不一致。 | 确切的差异、版本和日期。 |
| 来源未支持 | 材料可读但未提供声明的证据。 | 缺失的基础;不要自动将其视为虚假。 |
| 未提供来源 | 该答案未提供任何可归属于该声明的实质性内容。 | 缺乏引用;单独评估事实准确性。 |
| 无法验证 | 由于无法访问、归属不确定或缺少必要的版本,无法得出结论。 | 原因和缺失的证据。 |
让第二个人审查有争议的情况。如果您更改了分类规则,请记录新版本并重新评估正在比较的材料。这可以防止仅标签变化导致结果变化。
通过一个涉及服务条件的示例来处理
设想一款虚构软件,其当前文档仅在专业版中提供集成。其支持政策描述了通常的首次响应时间为48个工作小时,且无保证的SLA。产品页面未描述文件导出功能。这是一个训练示例,而非对Semly或其他真实公司的描述。
| AI声明 | 分配的源内容 | 审计发现 |
|---|---|---|
| 该集成在每个计划中都可用。 | 该集成仅在专业版中可用。 | 相矛盾;“每个计划”改变了产品提供的范围。 |
| 支持回复保证在24小时内完成。 | 通常在48个工作小时内;无保证的SLA。 | 相矛盾;时间改变且增加了保证。 |
| 该产品支持CSV导出。 | 一般的产品描述未提及导出功能。 | 此源内容不支持;请单独检查功能文档。 |
不要因为链接页面未讨论该功能就将最终声明标记为错误。其他资源可能确认了导出功能。该事实将是真实的,而引用位置不正确。
当前页面内容无法证明答案生成时该页面的内容。在没有保存版本的情况下,评估与当前材料的一致性,并说明历史评估的局限性。
纠正原因并保留决策轨迹
如果您的文档不正确或含糊不清,请在产品负责人维护的位置进行改进。将条件放在承诺旁边,而不是把例外情况隐藏在遥远的常见问题中。当多个资源描述同一产品时,建立一个共享的当前事实来源; 博客与知识库之间的角色分工 可以有所帮助。
如果问题出在外部材料上,请为作者准备具体的更正,并附上证据。如果您的来源是正确的,但答案扭曲了其条件,请保留该示例并考虑通过产品的可用渠道报告。不要假设报告或页面编辑会立即改变答案。
优先考虑对客户的影响。承诺一个不存在的集成需要与使用不精确形容词不同的回应。为更正分配负责人和复查日期。将新答案与之前的答案并列,而不是覆盖历史记录。
将引用质量报告与可见度分开
在 Semly 中,您可以检查存储的答案及其来源。这些是评估的输入。品牌形象、正面情感或答案中的位置并不能证明每句话都符合文档。需分别验证证据和条件。
如果需要自定义指标,请将其定义为:完全支持的引用声明 / 评估的引用声明。在分母中包含前四个表格类别。单独报告没有来源的声明、无法验证的声明和排除原因。如果分母为零,则报告无结果,而不是 0%。
在百分比旁边显示数量和问题范围。此指标描述的是评估集合,而不是整体“AI 的真实性”。不要在没有解释的情况下合并不同的模式或市场。重复并不保证独立观察。
质量审核与测试修正效果是两项不同的任务。我们在以下文章中说明了对比方案: 前后文章更新测试中解释了比较计划;不要从单个改进的答案中推断因果关系。
保留有用内容并遵循 SEO 政策
审计可能只需要澄清一个条件,而不是发布更多类似的页面。Google 的 垃圾内容政策 描述了通过主要为操纵排名而创建、缺乏用户价值的页面进行的内容滥用行为。
保持信息清晰和最新,并使结构化数据与可见文本一致。 Google 搜索 AI 功能文档 指出 AI 概览和 AI 模式既不需要特殊的 Schema.org 类型,也不需要单独的 AI 文件。此指导适用于这些 Google 功能,而非所有模型的集合。
- 我保留了问题、完整答案、AI 产品、模式和日期。
- 我拆分了包含多个可验证承诺的句子。
- 我为特定声明分配了来源或标记不确定性。
- 我阅读了条件、产品版本和引用材料的范围。
- 我分别评估了事实准确性和引用支持。
- 我记录了检索日期和历史评估的局限性。
- 我指派了纠正负责人和复查方法。
- 我分离了报告中缺失的引用、无法访问的来源和已确认的错误。
常见问题:审计 AI 引用的正确性
链接到官方页面是否能验证整个答案?
不能。请检查具体的段落和指定的来源。官方材料可能只支持答案的一部分或不同的产品条件。
缺少来源是否意味着 AI 提供了虚假信息?
不是。这意味着答案没有提供明确的证据。您可以使用相关文档单独评估该事实。
您能用今天的页面评估旧的答案吗?
您可以将其与当前状态进行比较,但这并不能确定该来源在过去包含的内容。请记录两个日期并标记缺失的历史版本。
Semly 是否自动判断每个引用是否正确?
在此过程中,Semly 提供存储的答案和来源以供分析。判断资源是否支持特定事实及其条件是审计员的独立任务。
修正文档能否保证 AI 答案的准确性?
不能。它使明确的信息更容易获取,但不能保证来源选择或正确解释。请复查并保存可比较的答案。
分享: