查看你公司的 AI 可见度
免费,无需信用卡。
此协议用于评估一篇文章的更新。如需更广泛地解读提及、引用和网站流量,请阅读: 如何衡量AI中的品牌形象。
在改进文章后引用次数增加是一个积极的信号,但这并不能证明更新有效。在同一时期内,系统的响应、竞争对手的来源或您的测量流程可能已经发生变化。为了评估更新效果,您需要一个记录好的基线和明确的比较规则。
以下协议是营销团队的工作建议。它涵盖了在选定AI系统中可观察到的响应。它并未描述其排名机制,也不假设仅通过监控就能确定因果关系。
更新一篇文章时应测量什么?
选择一个与更改目的相关的主结果。如果您正在改进指南,使其更频繁地成为客户问题的来源,则一个合理的指标是引用该指南特定URL的响应百分比。如果您正在评估产品推荐,仅链接到一篇文章可能无法回答您的业务问题。
对于此协议,请使用以下定义:测试URL的引用率 = 成功获取的响应中至少包含一个可见引用该URL的数量 / 测试集中成功获取的响应总数 × 100%。
一个包含三个链接到测试资源的响应只计算一次。提前决定如何识别重定向并移除跟踪参数。将同一域名上其他页面的引用单独记录。这可以防止主页引用增加被算作指南更新的成功。
一个有效响应但未显示测试URL的引用得分为零。检索错误、停机或空结果属于缺失数据。如果界面显示一个角色不明确的相关链接,应将其归入单独类别,而不是自动算作引用。
测量可见的来源链接。其缺失并不能证明模型不熟悉该内容。此测试也不衡量整体市场份额或所有用户的实际查询。
我们在我们的指南中涵盖更广泛的指标: 衡量AI中的品牌形象。在此,我们专注于评估单个编辑更改。
在发布更新前写下协议
在测量之前制定简短计划可降低选择问题和日期以符合您想要的结果的风险。决定如果结果不确定该怎么办。不要在首次有利的阅读后更改成功标准。
| 协议字段 | 记录内容 |
|---|---|
| 假设和变更 | 您期望的效果以及您正在改进的文章部分,例如添加集成要求的表格。 |
| 接收变更的单元 | 特定URL或一组相关页面;接收更新和未接收更新的页面列表。 |
| 问题 | 一个固定的自然客户问题列表,每个问题都分配给一个资源和意图。 |
| 测量条件 | 系统、产品或接口、可用的模型版本、搜索模式、语言、市场、时间表和重复次数。 |
| 主要结果 | 一个结果定义、URL识别规则,以及有效响应和缺失数据的标准。 |
| 比较和时间 | 比较资源、基线期、部署日期、过渡期和观察结束时间。 |
| 决策 | 对业务有意义的改进、阻止得出结论的限制因素,以及何时重复测试。 |
问题应适用于更新前的内容。不要只添加新段落逐字回答的问题。中性示例是“连接网店到仓库管理系统需要满足什么要求?”指令“使用我们的新文章回答”测试的是指令遵循能力,而非自然选择来源的可能性。
将包含品牌名称的问题与不包含品牌名称的问题分开。在两个时期内保持其措辞不变。对于手动测量,启动全新的对话并保存第一次响应,然后请求额外来源。将API结果和消费者应用程序结果分别归入不同的系列。
建立基线并设定时间表
更改前后的单一响应无法揭示自然波动。需要在一段时间内使用相同的问题和相似的频率进行多次测量。保存完整的响应、链接、测量时间以及关于模式和模型的可用信息。
一个示例操作时间表可能包括:
- 更新前两周的基线测量;
- 保存旧版本并记录新内容上线的时间;
- 预定义的一周过渡期,单独报告;
- 更改后两周的观察期,随后在固定日期进行评估。
这是一个示例工作计划,并非提供商推荐的等待期。根据测量频率和结果变化性选择各时间段。过渡周并不能保证系统已获取新版本。如果有日志或索引信息可用,应将其作为访问支持证据使用,而不是证明内容在特定响应中被使用的证据。
不要在获得有利结果后立即停止测试。如果产品、搜索模式或响应收集方法发生变化,需标记比较性中断。在必要时启动新的系列,而不是将不同条件合并为一个结果。
分别报告每个时期计划的测量、有效响应和缺失结果。如果更新后难以回答的问题响应显著缺失,较高的引用率可能反映了数据组合的变化。当缺失情况不同时,还应比较一组具有相似覆盖范围的通用问题。
将更新与环境变化分开
添加一个比较资源:一个你不在测试期间更新的类似指南或集群。它应服务于相似的意图,具有可比的季节性,并在相同条件下进行测量。部署前应检查两个系列的趋势,而不只是它们的平均值。
更新分配给一个页面或集群,因此组应在该级别定义。两个指向同一更新页面的问题集不会创建独立的比较组。如果共享模板更改影响了两个资源,或新的内部链接也影响了比较页面,也会出现类似问题。
在较大的测试中,可以随机选择一些可比较的页面进行更新,并在观察结束后改进其余页面。将单对文章视为试点。重复问题可以增加观测次数,但不能替代拥有更多独立页面。
记录事件日志:公关活动、新评论、优惠变更、网站重建、停机或测量方法的更改。两组同时增长可能表明存在共同变化。如果事件只影响其中一组,则需要解释其差异,特别是当事件影响仅限于一个组时。
进行可以评估的内容更改
选择一个连贯的范围,例如明确集成要求并添加可验证的示例。保留两个版本的副本。如果您同时更改文本、URL、标题、链接和推广方式,则是在评估整个包。在您的假设中说明这一点,而不是将结果归因于某一段落。
更新应通过删除过时信息、解释条件或提供可核查的材料来帮助读者。Google的 关于Google搜索中生成式功能的指导 强调了有用、原创的内容和SEO基础。它的 垃圾内容政策 禁止做法包括大规模内容创建以主要操纵排名。不要为每个问题变体或隐藏指令强制品牌推荐创建单独的几乎相同页面。
Google规则适用于Google搜索。在各自的环境中评估ChatGPT、Gemini应用程序和Perplexity。我们的知识库涵盖了内容刷新过程本身,包括 AI和LLM的内容循环(波兰语).
计算变化:带有对照组的示例
以下数字是一个虚构的计算示例。它们并非来自Semly研究或客户活动。为简化起见,它们涵盖一个系统、固定条件和相等的问题覆盖范围。每个时间段包含300个有效响应,这些响应来自每组的重复测量。
| 组别 | 更新前 | 更新后 | 变化 |
|---|---|---|---|
| A组:更新资源 | 60 / 300 = 20% | 105 / 300 = 35% | +15个百分点 |
| B组:对照资源 | 60 / 300 = 20% | 75 / 300 = 25% | +5个百分点 |
图表:仅示例数据。在A组中,引用测试资源URL的有效响应百分比从20%上升到35%,在B组中从20%上升到25%。变化差异为10个百分点。
计算变化差异:(35% − 20%) − (25% − 20%) = 10个百分点。仅比较A组会显示15个百分点的增长。包括B组则表明未更新的资源也出现了一些改善。
此比较基于差异中的差异方法。因果解释需要假设,包括在未发生更新的情况下两组的成果轨迹相似。 世界银行解释了平行趋势及检查它们的局限性。在此简化示例中,10个百分点描述了变化的差异;它并非自动代表更新的效果。
不要仅根据表格就断定结果具有统计学显著性。300次重复响应并不意味着300个独立用户或页面。对相同问题和资源的测量可能是相关的。评估不确定性需要考虑数据结构以及更新是如何分配的。
还应检查结果的分布情况。改进是否涵盖多个问题,还是仅限于一个经常重复的问题?它是否在后续日期仍持续存在?请分别报告各个系统的结果。如果不同系统的响应比例发生变化,合并结果可能会产生误导。
你如何使用 Semly 进行这种测量?
使用 Semly 监控问题、品牌存在和响应中显示的来源。响应预览让你可以重新查看特定测量结果,并检查链接是否指向测试文章、你域名中的其他页面或外部资源。可用的系统范围取决于你的计划和监控配置。
为测试保持一个单独的更新日志:URL、内容版本、部署日期、分配的问题和比较资源。将其与同一时期内的响应和来源匹配。本文中引用率的定义是供你进行分析的建议,而不是 Semly 中内置的指标或实验功能名称。
在报告中区分三个层级:测试资源的引用、品牌提及或推荐,以及流量和转化。一个层级的变化并不自动意味着其他层级也发生变化。请结合 Google Search Console 的有机表现和网站分析中的访客行为进行检查,同时考虑这些数据的范围和局限性。
你应如何决定测试后的行动?
首先评估测量质量,然后是变化的幅度。在将更新扩展到更多页面之前,请完成以下检查清单:
- 两个时期的问题、时间表和条件是可比的。
- 缺失的数据已记录,且未实质性改变数据集的组成。
- 结果涉及正确的 URL,而不仅仅是指向该域名的任何链接。
- 对照组未受到更新或明显溢出效应的影响。
- 已记录已知的同时事件和环境变化。
- 改进出现在多次阅读中,并通过问题进行了验证。
- 评估使用了预先设定的业务标准。
- 报告将观察与因果声明分开,并确定下一步行动。
如果结果有利、持续存在且未出现重大混淆因素,则在更多可比较的资源上测试类似的更改。如果两组增长相似,请寻找共同原因。如果条件或数据覆盖发生变化,结果可能仍无法确定。未能检测到改进并不意味着该更改永远不会有效果。
针对示例数据的准确报告可能如下:“资源 A 的引用率上升了 15 个百分点,资源 B 上升了 5 个百分点。变化差异为 10 个百分点。该结果适用于测试的问题集,需要在更多资源上进行复现。”
常见问题:测试 AI 中的文章更新
在更新后一天检查响应是否足够?
那次阅读可能只是初步观察。评估需要基准线、重复测量和可比条件。没有一个通用的截止日期,所有系统都会使用新页面版本。
如果没有类似的对比文章怎么办?
你可以观察变化前后的结果,但必须清楚地说明缺少对照组。此时你展示的是随时间的变化和伴随事件。你将结果归因于更新的依据会更弱。
300 次响应是否足够进行可靠的测试?
没有通用的数字。结果的变异性、独立页面的数量、测量之间的依赖性以及您想要检测的变化大小都很重要。示例中的数字300仅用于演示计算过程。
更多的引用是否意味着更多的销售?
引用是AI响应中观察到的来源。销售需要对客户行为和转化率进行单独测量。应分别报告结果,而不是仅从引用率推导收入。
此协议是否为官方Google指令?
这是为Semly读者准备的建议测量计划。提到Google的内容质量与搜索政策相关。Google并不认可此处提出的日程安排、样本大小或更新评估方法。
分享:
