Blog
GEO

Hat die Aktualisierung Ihres Artikels die KI-Sichtbarkeit verbessert? So planen Sie einen Vorher-nachher-Test

Bewerten Sie eine Artikelaktualisierung mit einem festen Fragenkatalog, Messungen an mehreren Terminen und einem Vergleichsbeitrag. Dieser Leitfaden zeigt, wie Sie Quellenverweise auf eine bestimmte URL messen, die Veränderung berechnen und über weitere Maßnahmen entscheiden.

Ein Artikel, zwei Messfelder und eine Lupe veranschaulichen die KI-Sichtbarkeit vor und nach einer Inhaltsaktualisierung.

Mehr Quellenverweise nach einer Überarbeitung sind ein gutes Signal, beweisen aber noch nicht die Wirksamkeit der Änderung. Im selben Zeitraum können sich die Antworten des Systems, die Quellen der Konkurrenz oder das Messverfahren verändert haben. Für eine Bewertung brauchen Sie einen dokumentierten Ausgangswert und klare Vergleichsregeln.

Das folgende Protokoll ist ein Arbeitsvorschlag für Marketingteams. Es bezieht sich auf beobachtbare Antworten ausgewählter KI-Systeme. Es beschreibt weder deren Rankingmechanismen noch setzt es voraus, dass Monitoring allein einen ursächlichen Zusammenhang nachweist.

Was sollten Sie messen, wenn Sie einen Artikel ändern?

Wählen Sie eine zentrale Zielgröße, die zum Zweck der Änderung passt. Wenn Sie einen Leitfaden ergänzen, damit er häufiger als Quelle für Kundenfragen dient, ist der Anteil der Antworten mit einem Quellenverweis auf genau diesen Leitfaden ein sinnvoller Ansatz. Wenn Sie Produktempfehlungen bewerten, beantwortet ein Artikellink allein möglicherweise nicht Ihre geschäftliche Frage.

Verwenden Sie für dieses Protokoll folgende Definition: Quellenverweisquote der untersuchten URL = Anzahl erfolgreich erfasster Antworten mit mindestens einem sichtbaren Quellenverweis auf diese URL / Gesamtzahl erfolgreich erfasster Antworten im untersuchten Fragenkatalog × 100%.

Eine Antwort mit drei Links auf denselben untersuchten Beitrag zählt einmal. Legen Sie vorher fest, wie Sie Weiterleitungen erkennen und Trackingparameter entfernen. Verweise auf andere Unterseiten derselben Domain erfassen Sie getrennt. So wird ein Anstieg der Verweise auf die Startseite nicht als Erfolg der Leitfadenaktualisierung gewertet.

Eine gültige Antwort ohne sichtbaren Quellenverweis auf die untersuchte URL ergibt für diese Kennzahl null. Ein Abruffehler, eine Störung oder ein leeres Ergebnis gilt als fehlender Wert. Zeigt die Oberfläche einen verwandten Link mit unklarer Funktion, ordnen Sie ihn einer eigenen Kategorie zu, statt ihn automatisch als Quellenverweis zu zählen.

Wichtig

Messen Sie den sichtbaren Link zur Quelle. Ein fehlender Link beweist nicht, dass das Modell den Inhalt nicht kennt. Der Test misst außerdem weder den gesamten Marktanteil noch die tatsächlichen Anfragen aller Nutzer.

Eine größere Auswahl an Kennzahlen finden Sie im Leitfaden zur Messung der Markensichtbarkeit in KI. Hier geht es um die Bewertung einer einzelnen redaktionellen Änderung.

Dokumentieren Sie das Protokoll vor der Veröffentlichung der Änderung

Ein kurzer Plan vor Beginn der Messung verringert das Risiko, Fragen und Termine nach dem gewünschten Ergebnis auszuwählen. Legen Sie auch fest, wie Sie mit einem uneindeutigen Ergebnis umgehen. Ändern Sie das Erfolgskriterium nicht nach dem ersten günstigen Messwert.

ProtokollfeldWas dokumentiert werden sollte
Hypothese und ÄnderungErwarteter Effekt und überarbeiteter Artikelteil, etwa eine neue Tabelle mit Integrationsvoraussetzungen.
Einheit der ÄnderungBestimmte URL oder gesamter Cluster verwandter Seiten; Liste der aktualisierten und unveränderten Seiten.
FragenFester Katalog natürlicher Kundenfragen und Zuordnung jeder Frage zu einem Beitrag und einer Suchabsicht.
MessbedingungenSystem, Produkt oder Oberfläche, verfügbare Modellversion, Suchmodus, Sprache, Markt, Zeitplan und Anzahl der Wiederholungen.
Zentrale ZielgrößeEinheitliche Definition, Regeln zur URL-Erkennung sowie zur Einstufung gültiger Antworten und fehlender Daten.
Vergleich und ZeitraumVergleichsbeitrag, Ausgangszeitraum, Umsetzungsdatum, Übergangszeitraum und Ende der Beobachtung.
EntscheidungGeschäftlich relevante Verbesserung, Einschränkungen, die einen Schluss verhindern, und Termin für eine Wiederholung.

Die Fragen sollten auch vor der Aktualisierung zum Inhalt passen. Ergänzen Sie nicht ausschließlich Fragen, die der neue Absatz wortwörtlich beantwortet. Eine neutrale Frage wäre: „Welche Voraussetzungen müssen erfüllt sein, um einen Onlineshop mit einem Lagerverwaltungssystem zu verbinden?“ Die Anweisung „Beantworte die Frage anhand unseres neuen Artikels“ prüft die Befolgung einer Anweisung, nicht die natürliche Wahrscheinlichkeit der Quellenauswahl.

Trennen Sie Fragen mit Markennamen von Fragen ohne Markennamen. Behalten Sie in beiden Zeiträumen denselben Wortlaut bei. Beginnen Sie bei manuellen Messungen neue Gespräche und speichern Sie die erste Antwort, bevor Sie zusätzliche Quellen anfordern. Führen Sie Ergebnisse aus der API und der Endnutzeranwendung als getrennte Reihen.

Erfassen Sie den Ausgangszustand und legen Sie den Zeitplan fest

Eine einzelne Antwort vor und eine nach der Änderung bilden natürliche Schwankungen nicht ab. Messen Sie mehrfach über einen längeren Zeitraum, mit denselben Fragen und ähnlicher Häufigkeit. Speichern Sie vollständige Antworten, Links, Messzeitpunkte und verfügbare Angaben zu Modus und Modell.

Ein beispielhafter organisatorischer Zeitplan könnte umfassen:

  • zwei Wochen Ausgangsmessung vor der Aktualisierung;
  • Sicherung der alten Version und Dokumentation der Veröffentlichung der neuen Inhalte;
  • eine vorher festgelegte Übergangswoche, die getrennt ausgewiesen wird;
  • zwei Wochen Beobachtung nach der Änderung und Bewertung zu einem festgelegten Termin.

Das ist ein Beispiel für die Arbeitsplanung, keine von Anbietern empfohlene Wartezeit. Stimmen Sie die Zeiträume auf Messhäufigkeit und Ergebnisschwankungen ab. Eine Übergangswoche garantiert nicht, dass die Systeme die neue Version abgerufen haben. Verfügbare Logs oder Indexierungsinformationen dienen als ergänzende Hinweise auf einen Zugriff, nicht als Beweis der Nutzung in einer bestimmten Antwort.

Beenden Sie den Test nicht sofort nach einem günstigen Messwert. Ändern sich Produkt, Suchmodus oder Erfassungsverfahren, kennzeichnen Sie die Unterbrechung der Vergleichbarkeit. Beginnen Sie bei Bedarf eine neue Reihe, statt unterschiedliche Bedingungen in einem Ergebnis zusammenzuführen.

Weisen Sie geplante Messungen, gültige Antworten und fehlende Werte für jeden Zeitraum getrennt aus. Fehlen nach der Aktualisierung vor allem Antworten auf schwierige Fragen, kann die höhere Quellenverweisquote auf eine veränderte Datenzusammensetzung zurückgehen. Vergleichen Sie bei ungleichen Ausfällen zusätzlich einen gemeinsamen Fragenkatalog mit ähnlicher Abdeckung.

Trennen Sie die Aktualisierung von Veränderungen im Umfeld

Ergänzen Sie einen Vergleichsbeitrag: einen ähnlichen Leitfaden oder Cluster, den Sie während des Tests nicht aktualisieren. Er sollte eine ähnliche Suchabsicht bedienen, eine vergleichbare Saisonalität aufweisen und unter denselben Bedingungen gemessen werden. Prüfen Sie vor der Umsetzung den Verlauf beider Reihen, nicht nur deren Durchschnitt.

Die Aktualisierung wird einer Seite oder einem Cluster zugewiesen. Entsprechend sollte auch die Gruppenbildung auf dieser Ebene erfolgen. Zwei Fragenkataloge, die auf dieselbe überarbeitete Seite verweisen, bilden keine unabhängige Vergleichsgruppe. Ein ähnliches Problem entsteht, wenn eine gemeinsame Vorlage beide Beiträge verändert oder neue interne Links auch die Vergleichsseite beeinflussen.

Bei einem größeren Test können Sie einige vergleichbare Seiten zufällig zur Aktualisierung auswählen und die übrigen erst nach der Beobachtung überarbeiten. Ein einzelnes Artikelpaar ist als Pilotversuch zu behandeln. Wiederholte Fragen erhöhen die Zahl der Beobachtungen, ersetzen aber nicht mehr unabhängige Seiten.

Führen Sie ein Ereignisprotokoll: PR-Kampagne, neue Rezension, Angebotsänderung, Website-Umbau, Störung oder Änderung des Messverfahrens. Gleichzeitiges Wachstum in beiden Gruppen kann auf eine gemeinsame Veränderung hindeuten. Auch Gruppenunterschiede brauchen eine Erklärung, besonders wenn ein Ereignis nur eine Gruppe betraf.

Ändern Sie Inhalte so, dass sich die Änderung bewerten lässt

Wählen Sie einen zusammenhängenden Umfang, etwa die Ergänzung von Integrationsvoraussetzungen und eines überprüfbaren Beispiels. Bewahren Sie beide Versionen auf. Ändern Sie gleichzeitig Text, URL, Titel, Verlinkung und Werbung, bewerten Sie das gesamte Maßnahmenpaket. Halten Sie das in der Hypothese fest, statt das Ergebnis einem Absatz zuzuschreiben.

Die Überarbeitung sollte Lesern helfen: veraltete Informationen entfernen, Bedingungen erklären oder überprüfbare Belege liefern. In den Hinweisen zu generativen Funktionen von Google Search betont Google hilfreiche, originelle Inhalte und SEO-Grundlagen. Die Spamrichtlinien verbieten unter anderem die massenhafte Erstellung von Inhalten hauptsächlich zur Rankingmanipulation. Erstellen Sie keine fast identischen Seiten für jede Fragevariante und keine versteckten Anweisungen, die eine Markenempfehlung erzwingen sollen.

Googles Regeln gelten für Google Search. Bewerten Sie ChatGPT, Gemini Apps und Perplexity jeweils in ihrer eigenen Umgebung. Die eigentliche Überarbeitung beschreiben wir in der Wissensdatenbank unter Content-Recycling für KI und LLMs (auf Polnisch).

Berechnen Sie die Veränderung: ein Beispiel mit Vergleichsgruppe

Die folgenden Zahlen sind ein erfundenes Rechenbeispiel. Sie stammen weder aus einer Semly-Studie noch aus einer Kundenkampagne. Zur Vereinfachung gelten ein System, feste Bedingungen und eine gleichmäßige Fragenabdeckung. In beiden Gruppen enthält jeder Zeitraum 300 gültige Antworten aus wiederholten Messungen.

GruppeVor der AktualisierungNach der AktualisierungVeränderung
A: aktualisierter Beitrag60 / 300 = 20%105 / 300 = 35%+15 Prozentpunkte
B: Vergleichsbeitrag60 / 300 = 20%75 / 300 = 25%+5 Prozentpunkte

Diagramm: ausschließlich illustrative Daten. Der Anteil gültiger Antworten mit einem Quellenverweis auf die untersuchte URL stieg in Gruppe A von 20% auf 35% und in Gruppe B von 20% auf 25%. Die Differenz der Veränderungen beträgt 10 Prozentpunkte.

Berechnung der Differenz der Veränderungen: (35% − 20%) − (25% − 20%) = 10 Prozentpunkte. Die alleinige Betrachtung von Gruppe A ergäbe einen Anstieg um 15 Prozentpunkte. Gruppe B zeigt, dass ein Teil der Verbesserung auch beim unveränderten Beitrag auftrat.

Dieses Vorgehen orientiert sich an der Differenz-von-Differenzen-Methode. Eine kausale Interpretation setzt Annahmen voraus, darunter ähnliche Ergebnisverläufe beider Gruppen ohne Aktualisierung. Die Weltbank erläutert parallele Trends und die Grenzen ihrer Überprüfung. In diesem vereinfachten Beispiel beschreiben die 10 Prozentpunkte die Differenz der Veränderungen und sind nicht automatisch der Effekt der Aktualisierung.

Bezeichnen Sie das Ergebnis nicht allein anhand der Tabelle als statistisch signifikant. 300 wiederholte Antworten bedeuten nicht 300 unabhängige Nutzer oder Seiten. Messungen derselben Fragen und Beiträge können voneinander abhängig sein. Für die Bewertung der Unsicherheit müssen Datenstruktur und Zuweisung der Aktualisierungen berücksichtigt werden.

Prüfen Sie auch die Verteilung des Ergebnisses. Betrifft die Verbesserung viele Fragen oder eine häufig wiederholte Frage? Hält sie an späteren Terminen an? Berichten Sie Systeme getrennt. Ein Gesamtergebnis kann irreführend sein, wenn sich die Anteile der Antworten aus den einzelnen Systemen verändert haben.

Wie können Sie Semly bei dieser Messung einsetzen?

Nutzen Sie Semly zur Beobachtung von Fragen, Markenpräsenz und in Antworten genannten Quellen. Über die Antwortvorschau können Sie zu einer bestimmten Messung zurückkehren und prüfen, ob ein Link zum untersuchten Artikel, zu einer anderen Seite Ihrer Domain oder zu einem externen Beitrag führt. Die verfügbaren Systeme hängen von Tarif und Monitoringkonfiguration ab.

Führen Sie für den Test ein separates Änderungsregister: URL, Inhaltsversion, Umsetzungsdatum, zugeordnete Fragen und Vergleichsbeitrag. Gleichen Sie es mit Antworten und Quellen aus denselben Zeiträumen ab. Die hier definierte Quellenverweisquote ist ein Vorschlag für Ihre eigene Analyse, kein Name einer fertigen Kennzahl oder Experimentfunktion in Semly.

Trennen Sie im Bericht drei Ebenen: Quellenverweise auf den untersuchten Beitrag, Markenerwähnungen oder Empfehlungen sowie Traffic und Conversions. Eine Veränderung auf einer Ebene bedeutet nicht automatisch eine Veränderung auf den anderen. Prüfen Sie organische Ergebnisse parallel in Google Search Console und das Besucherverhalten in der Webanalyse unter Berücksichtigung von Umfang und Grenzen dieser Daten.

Wie treffen Sie nach dem Test eine Entscheidung?

Bewerten Sie zuerst die Messqualität, dann die Größe der Veränderung. Prüfen Sie vor einer Ausweitung auf weitere Seiten folgende Punkte:

  • Fragen, Zeitplan und Bedingungen sind in beiden Zeiträumen vergleichbar.
  • Fehlende Daten sind dokumentiert und haben die Zusammensetzung des Fragenkatalogs nicht wesentlich verändert.
  • Das Ergebnis betrifft die richtige URL und nicht irgendeinen Link zur Domain.
  • Die Vergleichsgruppe wurde weder von der Änderung noch von einer offensichtlichen Folgewirkung erfasst.
  • Bekannte parallele Ereignisse und Veränderungen im Umfeld sind dokumentiert.
  • Die Verbesserung zeigt sich in mehr als einer Messung und wurde nach Fragen überprüft.
  • Die Bewertung bezieht sich auf das zuvor festgelegte geschäftliche Kriterium.
  • Der Bericht trennt Beobachtungen von Aussagen über Ursachen und benennt den nächsten Schritt.

Ist das Ergebnis günstig, hält es an und sind keine wesentlichen Störfaktoren erkennbar, testen Sie eine ähnliche Änderung an weiteren vergleichbaren Beiträgen. Wachsen beide Gruppen ähnlich, suchen Sie nach einer gemeinsamen Ursache. Bei veränderten Bedingungen oder veränderter Datenabdeckung kann das Ergebnis offenbleiben. Eine nicht nachgewiesene Verbesserung beweist nicht, dass die Änderung niemals helfen wird.

Eine sachgerechte Formulierung zum Beispiel wäre: „Die Quellenverweisquote von Beitrag A stieg um 15 Prozentpunkte, die von Beitrag B um 5. Die Differenz der Veränderungen betrug 10 Prozentpunkte. Das Ergebnis gilt für den untersuchten Fragenkatalog und muss an mehr Beiträgen wiederholt werden.“

FAQ: Artikelaktualisierungen in KI testen

Reicht eine Prüfung am Tag nach der Aktualisierung?

Dieser Messwert kann eine erste Beobachtung sein. Für die Bewertung benötigen Sie Ausgangswerte, wiederholte Messungen und vergleichbare Bedingungen. Es gibt keine allgemeine Frist, nach der jedes System die neue Seitenversion verwendet.

Was tun, wenn kein ähnlicher Vergleichsartikel vorhanden ist?

Sie können vor und nach der Änderung messen, sollten die fehlende Vergleichsgruppe aber klar benennen. Dann zeigen Sie eine zeitliche Veränderung und begleitende Ereignisse. Die Grundlage, das Ergebnis der Aktualisierung zuzuschreiben, ist schwächer.

Reichen 300 Antworten für einen verlässlichen Test?

Es gibt keine allgemeingültige Zahl. Entscheidend sind Ergebnisschwankungen, die Zahl unabhängiger Seiten, Abhängigkeiten zwischen Messungen und die gesuchte Effektgröße. Die Zahl 300 dient im Beispiel ausschließlich der Veranschaulichung der Rechnung.

Bedeuten mehr Quellenverweise mehr Umsatz?

Ein Quellenverweis ist eine beobachtbare Quellenangabe in einer KI-Antwort. Verkäufe erfordern eine gesonderte Messung des Kundenverhaltens und der Conversions. Berichten Sie beide Ergebnisse getrennt, statt Umsatz allein aus der Quellenverweisquote abzuleiten.

Ist dieses Protokoll eine offizielle Google-Anleitung?

Es handelt sich um einen vorgeschlagenen Messplan für Semly-Leser. Die Google-Verweise betreffen Inhaltsqualität und Suchrichtlinien. Google bestätigt hier weder Zeitplan noch Stichprobengröße oder Bewertungsmethode.

Teilen:

Lesen Sie andere Artikel über KI
eCommerce

Wie bringen Sie AI dazu, über Ihr Geschäft zu sprechen?

Lernen Sie, was Sie tun müssen, damit KI-Modelle (wie ChatGPT oder Gemini) Ihren Shop und Ihre Produkte empfehlen. Lernen Sie die wichtigsten Strategien zur Strukturierung von Inhalten und wie Sie die Semly-Plattform nutzen, um kostenlosen Traffic zu erhalten, der bis zu doppelt so gut konvertiert! Wir bringen Ihnen einen Leitfaden zur Generativen Suchmaschinenoptimierung (GEO).

eCommerce

E-Commerce-Architektur unter GenAI: API, Daten und JSON

Erfahren Sie, wie Sie Ihre Online-Shop-Architektur für generative KI vorbereiten. In diesem Artikel besprechen wir die Optimierung von JSON-Strukturen, das Design effizienter APIs für KI-Agenten und die technischen Aspekte des Produktdatenmanagements, die die Halluzinationen von LLM-Modellen beseitigen.

AEO

Schritt für Schritt zum AEO-Audit - AI visible shop

Sie lernen, wie Sie Schritt für Schritt die Sichtbarkeit Ihres Online-Shops in den KI-Assistenten (ChatGPT, Gemini, Perplexity) überprüfen, Lücken im Inhalt und in den strukturierten Daten identifizieren, Benchmarks mit Wettbewerbern durchführen und Tools wie Semly nutzen, um die Sichtbarkeit von Marken in der KI-Suche zu überwachen.

eCommerce

Wie integriert man einen Shop mit KI ohne einen Code?

Antwortmaschinen - ChatGPT, Google AI Overviews, Perplexity - entwickeln sich zu einer brauchbaren Quelle für Traffic und Umsatz. Anstatt nur nach Klicks zu jagen, sollten Sie dafür sorgen, dass Ihre Produktblätter und Kaufrichtlinien von den Modellen verstanden und von ihnen leicht zitiert werden können. Die gute Nachricht: Dies kann ohne Programmierer in wenigen Minuten mit No-Code-Tools (z. B. Semly.ai) eingerichtet werden.

Überprüfen Sie, ob AI ChatGPT Ihre Marke sieht

Erhalten Sie Ihren ersten AI-Sichtbarkeitsbericht in wenigen Minuten.