Comprueba la visibilidad de tu empresa en IA
Gratis y sin tarjeta de crédito.
Más citas tras mejorar un texto son una buena señal, pero todavía no demuestran que la actualización haya funcionado. Durante el mismo periodo pueden haber cambiado las respuestas del sistema, las fuentes de la competencia o el procedimiento de medición. Para evaluar la actualización necesitas una referencia inicial documentada y reglas claras de comparación.
El siguiente protocolo es una propuesta de trabajo para equipos de marketing. Se centra en las respuestas observables de determinados sistemas de IA. No describe sus mecanismos de posicionamiento ni presupone que la monitorización, por sí sola, establezca causalidad.
¿Qué medir cuando modificas un solo artículo?
Elige un resultado principal relacionado con el objetivo del cambio. Si amplías una guía para que se utilice más a menudo como fuente al responder a clientes, un objetivo razonable es el porcentaje de respuestas que citan la URL concreta de esa guía. Si evalúas recomendaciones de productos, un enlace al artículo puede no responder por sí solo a tu pregunta de negocio.
Para este protocolo, utiliza esta definición: tasa de citas de la URL analizada = número de respuestas obtenidas correctamente con al menos una cita visible de esa URL / número total de respuestas obtenidas correctamente en el conjunto analizado × 100%.
Una respuesta con tres enlaces al recurso analizado cuenta una vez. Define de antemano cómo reconocerás redirecciones y eliminarás parámetros de seguimiento. Registra por separado las citas de otras páginas del mismo dominio. Así, un aumento de citas de la página de inicio no se interpretará como un éxito de la actualización de la guía.
Una respuesta válida sin una cita visible de la URL analizada equivale a cero en esta medida. Un error de recuperación, una interrupción o un resultado vacío es un dato ausente. Si la interfaz muestra un enlace relacionado cuya función no está clara, clasifícalo por separado en lugar de contarlo automáticamente como cita.
Mide el enlace visible a la fuente. Su ausencia no demuestra que el modelo desconozca el contenido. Esta prueba tampoco mide la cuota de todo el mercado ni las consultas reales de todos los usuarios.
Presentamos más indicadores en la guía sobre cómo medir la visibilidad de una marca en IA. Aquí nos centramos en evaluar un único cambio editorial.
Documenta el protocolo antes de publicar la actualización
Un plan breve preparado antes de medir reduce el riesgo de escoger preguntas y fechas en función del resultado que quieres obtener. Decide también qué harás si el resultado es inconcluyente. No cambies el criterio de éxito tras la primera medición favorable.
| Campo del protocolo | Qué registrar |
|---|---|
| Hipótesis y cambio | El efecto esperado y la parte del artículo que mejoras, por ejemplo una tabla de requisitos de integración. |
| Unidad que recibe el cambio | Una URL concreta o un grupo de páginas relacionadas; lista de páginas actualizadas y sin actualizar. |
| Preguntas | Lista fija de preguntas naturales de clientes, vinculando cada una a un recurso y una intención. |
| Condiciones de medición | Sistema, producto o interfaz, versión disponible del modelo, modo de búsqueda, idioma, mercado, calendario y repeticiones. |
| Resultado principal | Una definición del resultado, reglas para identificar URL y criterios para respuestas válidas y datos ausentes. |
| Comparación y tiempo | Recurso de comparación, periodo inicial, fecha de implementación, periodo de transición y fin de la observación. |
| Decisión | Mejora relevante para el negocio, limitaciones que impiden concluir y fecha para repetir la prueba. |
Las preguntas también deben encajar con el contenido anterior a la actualización. No añadas únicamente preguntas que el nuevo párrafo responda de forma literal. Un ejemplo neutral sería: «¿Qué requisitos hay que cumplir para conectar una tienda online con un sistema de gestión de almacenes?». La instrucción «Responde basándote en nuestro nuevo artículo» evalúa el seguimiento de instrucciones, no la probabilidad natural de seleccionar una fuente.
Separa las preguntas con el nombre de la marca de las que no lo contienen. Mantén su redacción en ambos periodos. En las mediciones manuales, inicia conversaciones nuevas y guarda la primera respuesta antes de pedir fuentes adicionales. Trata los resultados de la API y de la aplicación de consumo como series distintas.
Establece la referencia inicial y el calendario
Una sola respuesta antes del cambio y otra después no reflejan las fluctuaciones naturales. Realiza varias mediciones distribuidas en el tiempo, con las mismas preguntas y una frecuencia similar. Guarda las respuestas completas, enlaces, fechas y horas, e información disponible sobre el modo y el modelo.
Un calendario operativo de ejemplo podría incluir:
- dos semanas de medición inicial antes de la actualización;
- conservación de la versión anterior y registro de la fecha de implementación del nuevo contenido;
- una semana de transición definida previamente y presentada por separado;
- dos semanas de observación posterior y evaluación en una fecha fijada.
Es un ejemplo de planificación, no un plazo de espera recomendado por los proveedores. Ajusta los periodos a la frecuencia de medición y a la variabilidad de los resultados. Una semana de transición no garantiza que los sistemas hayan recuperado la nueva versión. Si hay registros de acceso o información de indexación, úsalos como indicios complementarios de acceso, no como prueba de uso del contenido en una respuesta concreta.
No termines la prueba inmediatamente después de una lectura favorable. Si cambia el producto, el modo de búsqueda o la forma de recopilar respuestas, señala la pérdida de comparabilidad. Cuando sea necesario, inicia una nueva serie en lugar de combinar condiciones diferentes en un solo resultado.
Informa por separado de mediciones previstas, respuestas válidas y datos ausentes en cada periodo. Si después de la actualización faltan sobre todo respuestas a preguntas difíciles, la mayor tasa de citas puede deberse a un cambio en la composición de los datos. Si las ausencias difieren, compara además un conjunto común de preguntas con cobertura similar.
Separa la actualización de los cambios del entorno
Añade un recurso de comparación: una guía o un grupo similar que no actualices durante la prueba. Debe responder a una intención parecida, tener una estacionalidad comparable y medirse en las mismas condiciones. Examina la evolución de ambas series antes de implementar el cambio, no solo sus medias.
La actualización se asigna a una página o a un grupo, por lo que los grupos de comparación deben definirse a ese nivel. Dos conjuntos de preguntas que llevan a la misma página actualizada no constituyen un grupo de comparación independiente. Surge un problema similar si una modificación de la plantilla compartida afecta a ambos recursos o los nuevos enlaces internos influyen también en la página de comparación.
En una prueba mayor, puedes seleccionar al azar algunas páginas comparables para actualizarlas y mejorar las restantes al terminar la observación. Una sola pareja de artículos debe tratarse como prueba piloto. Repetir preguntas aumenta las observaciones, pero no sustituye disponer de más páginas independientes.
Lleva un registro de acontecimientos: campaña de relaciones públicas, nueva reseña, cambio de oferta, renovación del sitio, interrupción o cambio del método de medición. El crecimiento simultáneo de ambos grupos puede señalar un cambio compartido. Las diferencias entre grupos también necesitan explicación, especialmente si un acontecimiento afectó solo a uno.
Introduce cambios de contenido que puedan evaluarse
Elige un alcance coherente, como aclarar requisitos de integración y añadir un ejemplo verificable. Conserva ambas versiones. Si cambias a la vez texto, URL, título, enlaces y promoción, evalúas el efecto del paquete completo. Indícalo en la hipótesis en lugar de atribuir el resultado a un único párrafo.
La mejora debe ayudar al lector: eliminar información obsoleta, explicar condiciones o aportar material verificable. En las directrices para funciones generativas de Google Search, Google destaca el contenido útil y original y los fundamentos de SEO. Las políticas de spam prohíben, entre otras prácticas, crear contenido a gran escala principalmente para manipular el posicionamiento. No generes páginas casi idénticas para cada variante de pregunta ni instrucciones ocultas que fuercen la recomendación de una marca.
Las reglas de Google se aplican a Google Search. Evalúa ChatGPT, Gemini Apps y Perplexity en sus propios entornos. El proceso de actualización del contenido se describe en nuestra base de conocimiento: reciclaje de contenido para IA y LLM (en polaco).
Calcula el cambio: ejemplo con un grupo de comparación
Las cifras siguientes son un ejemplo inventado de cálculo. No proceden de un estudio de Semly ni de una campaña de un cliente. Para simplificar, corresponden a un sistema, condiciones constantes y la misma cobertura de preguntas. En cada grupo, cada periodo contiene 300 respuestas válidas de mediciones repetidas.
| Grupo | Antes de actualizar | Después de actualizar | Cambio |
|---|---|---|---|
| A: recurso actualizado | 60 / 300 = 20% | 105 / 300 = 35% | +15 puntos porcentuales |
| B: recurso de comparación | 60 / 300 = 20% | 75 / 300 = 25% | +5 puntos porcentuales |
Gráfico: datos exclusivamente ilustrativos. El porcentaje de respuestas válidas que citan la URL del recurso analizado pasó del 20% al 35% en el grupo A y del 20% al 25% en el B. La diferencia entre los cambios es de 10 puntos porcentuales.
Cálculo de la diferencia entre cambios: (35% − 20%) − (25% − 20%) = 10 puntos porcentuales. Comparar solo el grupo A mostraría un aumento de 15 puntos porcentuales. Incluir el B revela que parte de la mejora también se produjo en el recurso sin actualizar.
Esta comparación se inspira en el método de diferencias en diferencias. La interpretación causal requiere supuestos, incluida una evolución similar de ambos grupos si la actualización no hubiera ocurrido. El Banco Mundial explica las tendencias paralelas y los límites de su comprobación. En este ejemplo simplificado, los 10 puntos porcentuales describen la diferencia entre cambios, no automáticamente el efecto de la actualización.
No califiques el resultado de estadísticamente significativo basándote solo en la tabla. 300 respuestas repetidas no equivalen a 300 usuarios o páginas independientes. Las mediciones de las mismas preguntas y recursos pueden estar relacionadas. Evaluar la incertidumbre exige considerar la estructura de los datos y la asignación de las actualizaciones.
Examina también la distribución del resultado. ¿La mejora aparece en muchas preguntas o en una que se repite a menudo? ¿Se mantiene en fechas posteriores? Informa de cada sistema por separado. El resultado agregado puede inducir a error si cambian las proporciones de respuestas de cada sistema.
¿Cómo utilizar Semly en esta medición?
Utiliza Semly para observar preguntas, presencia de marca y fuentes mostradas en las respuestas. La vista de respuestas permite volver a una medición concreta y comprobar si un enlace conduce al artículo analizado, a otra página de tu dominio o a un recurso externo. Los sistemas disponibles dependen del plan y de la configuración de monitorización.
Para la prueba, mantén un registro independiente de actualizaciones: URL, versión del contenido, fecha de implementación, preguntas asignadas y recurso de comparación. Relaciónalo con las respuestas y fuentes de los mismos periodos. La tasa de citas definida en este artículo es una propuesta para tu propio análisis, no el nombre de una métrica integrada o una función de experimentos de Semly.
Separa tres niveles en el informe: citas del recurso analizado, menciones o recomendaciones de marca, y tráfico y conversiones. Un cambio en un nivel no implica automáticamente cambios en los demás. Revisa el rendimiento orgánico en Google Search Console y el comportamiento de los visitantes en la analítica web, teniendo en cuenta el alcance y las limitaciones de esos datos.
¿Cómo decidir tras finalizar la prueba?
Evalúa primero la calidad de la medición y después la magnitud del cambio. Antes de extender la actualización a más páginas, revisa esta lista:
- Las preguntas, el calendario y las condiciones son comparables en ambos periodos.
- Los datos ausentes están documentados y no han cambiado sustancialmente la composición del conjunto.
- El resultado corresponde a la URL correcta, no a cualquier enlace del dominio.
- El grupo de comparación no recibió la actualización ni un efecto indirecto evidente.
- Los acontecimientos simultáneos conocidos y los cambios del entorno están registrados.
- La mejora aparece en más de una medición y se ha comprobado por pregunta.
- La evaluación utiliza el criterio de negocio establecido de antemano.
- El informe distingue observaciones de conclusiones causales e indica el siguiente paso.
Si el resultado es favorable, se mantiene y no observas factores de confusión importantes, prueba un cambio similar en más recursos comparables. Si ambos grupos crecen de forma similar, busca una causa común. Si cambian las condiciones o la cobertura de los datos, el resultado puede seguir siendo inconcluyente. No detectar una mejora no demuestra que el cambio nunca vaya a ayudar.
Un registro fiel de los datos del ejemplo sería: «La tasa de citas del recurso A aumentó 15 puntos porcentuales y la del B, 5. La diferencia entre cambios fue de 10 puntos porcentuales. El resultado corresponde al conjunto de preguntas analizado y requiere repetirse con más recursos».
Preguntas frecuentes: probar la actualización de un artículo en IA
¿Basta con comprobar una respuesta al día siguiente de actualizar?
Puede servir como primera observación. La evaluación necesita una referencia inicial, mediciones repetidas y condiciones comparables. No existe un plazo universal tras el cual todos los sistemas utilicen la nueva versión de una página.
¿Qué hago si no tengo un artículo similar para comparar?
Puedes observar los resultados antes y después, pero indica claramente que no hay grupo de comparación. Mostrarás un cambio temporal y acontecimientos asociados. La base para atribuir el resultado a la actualización será más débil.
¿Son suficientes 300 respuestas para una prueba fiable?
No hay una cifra universal. Importan la variabilidad del resultado, el número de páginas independientes, las relaciones entre mediciones y la magnitud del cambio que quieres detectar. Las 300 respuestas del ejemplo solo sirven para ilustrar el cálculo.
¿Más citas significan más ventas?
Una cita es una fuente observada en una respuesta de IA. Las ventas requieren medir por separado el comportamiento de los clientes y las conversiones. Informa de ambos resultados de forma independiente, sin deducir ingresos únicamente de la tasa de citas.
¿Este protocolo es una instrucción oficial de Google?
Es una propuesta de medición para los lectores de Semly. Las referencias a Google tratan de calidad del contenido y políticas de búsqueda. Google no avala aquí el calendario, el tamaño de la muestra ni el método de evaluación.
Compartir:
