Obtención de Consultas: Recopilación de Datos de Búsqueda de Múltiples Fuentes

Este artículo explica cómo recopilamos consultas de búsqueda de cinco fuentes diferentes para construir un conjunto de datos integral para la canalización SEO.

El Problema: Datos de Consultas Incompletos

Depender de una única fuente de datos da una imagen incompleta:

  • Google Search Console: Solo muestra las consultas que generaron clics (se pierden consultas con muchas impresiones y bajo CTR)

  • Google Ads: Solo muestra términos de búsqueda de pago (se pierde el tráfico orgánico)

  • Registros de búsqueda en vivo: Solo muestra búsquedas en el sitio (se pierde el descubrimiento externo)

  • Algolia: Solo muestra consultas de autocompletado (se pierden búsquedas completas)

Necesitamos agregar consultas de todas las fuentes para entender el panorama completo de búsqueda.

Descripción General: Cinco Fuentes de Consultas

La canalización obtiene datos de cinco fuentes:

  • Google Search Console: Consultas de búsqueda orgánica con métricas de interacción

  • Google Ads: Términos de búsqueda de pago con datos de conversión

  • Registros de búsqueda en vivo: Consultas de usuarios en el sitio

  • Analíticas de Algolia: Consultas de búsqueda de autocompletado

  • Keyword Planner: Sugerencias de palabras clave relacionadas

Cada fuente proporciona diferentes perspectivas; combinadas crean un conjunto de datos de consultas integral.

Paso 1: Obtener Consultas de Cada Fuente

1.1 Google Search Console (GSC)

Propósito: Recopilar consultas de búsqueda orgánica que generaron clics.

Entrada: URL del sitio web verificada en Search Console.

Salida: Lista de consultas con métricas de interacción (consultas, clics, impresiones, CTR, posición).

Especificaciones de datos:

  • Texto de la consulta

  • Clics (número de usuarios que hicieron clic en nuestro resultado)

  • Impresiones (número de veces que apareció nuestro resultado)

  • CTR (tasa de clics como porcentaje)

  • Posición promedio en los resultados de búsqueda

Período retrospectivo: 90 días (máximo para datos detallados de consultas)

Filtrado: Mínimo 1 clic (excluye consultas que solo tienen impresiones)

Acceso: API de Google Search Console mediante cuenta de servicio con alcance de solo lectura

1.2 Términos de Búsqueda de Google Ads

Propósito: Recopilar términos de búsqueda de pago que activaron anuncios.

Entrada: Cuenta de Google Ads con acceso de cuenta de administrador.

Salida: Lista de términos de búsqueda con métricas de rendimiento (términos, impresiones, clics, costo).

Especificaciones de datos:

  • Texto del término de búsqueda

  • Impresiones (número de vistas del anuncio)

  • Clics (número de clics en el anuncio)

  • Costo en micros (1 millón de unidades = 1 unidad monetaria)

Período retrospectivo: 2 años (todos los datos históricos disponibles)

Agregación: Combina datos de todas las cuentas autorizadas

Filtrado: Mínimo 1 impresión

Acceso: API de Google Ads mediante OAuth2

1.3 Consultas de Búsqueda en Vivo

Propósito: Recopilar consultas de búsqueda de usuarios en el sitio.

Entrada: Registros de búsqueda internos del servicio de búsqueda.

Salida: Lista de consultas con métricas de frecuencia (consultas, recuentos, interacción).

Especificaciones de datos:

  • Texto de la consulta

  • Frecuencia (número de veces buscada)

  • Datos de interacción (búsquedas que llevaron a interacciones con productos)

Período retrospectivo: Varía (típicamente 30-90 días según la retención de registros)

Ponderación: Las consultas se ponderan por interacción (las búsquedas con interacciones tienen una puntuación más alta)

Filtrado: Eliminar duplicados y contar ocurrencias

1.4 Búsquedas Principales de Algolia

Propósito: Recopilar búsquedas de autocompletado de las analíticas de Algolia.

Entrada: Datos de analíticas de búsqueda de Algolia.

Salida: Lista de consultas de búsqueda principales con frecuencia (búsquedas principales, recuentos).

Especificaciones de datos:

  • Texto de la consulta

  • Recuento de búsquedas (número de veces buscada)

Período retrospectivo: 90 días

Filtrado: Limitar a búsquedas recientes de alto volumen

Acceso: API de Analíticas de Algolia mediante credenciales de aplicación

1.5 Ideas de Keyword Planner

Propósito: Recopilar sugerencias de palabras clave relacionadas.

Entrada: Palabras clave semilla (categorías de productos, familias, términos de búsqueda comunes).

Salida: Lista de palabras clave con métricas (palabras clave, volumen de búsqueda, competencia, sugerencias de oferta).

Especificaciones de datos:

  • Texto de la palabra clave

  • Búsquedas mensuales promedio

  • Nivel de competencia (bajo, medio, alto)

  • Valor de oferta sugerido

Filtrado: Solo palabras clave relevantes (excluir sugerencias no relacionadas)

Acceso: API de Keyword Planner de Google Ads mediante OAuth2

Paso 2: Normalizar y Agregar Consultas

2.1 Normalizar el Texto de la Consulta

Las consultas se estandarizan antes de la agregación:

  • Convertir a minúsculas

  • Normalizar espacios en blanco (colapsar múltiples espacios a uno solo)

  • Recortar espacios en blanco iniciales/finales

  • Eliminar caracteres especiales (cuando sea aplicable)

2.2 Combinar y Eliminar Duplicados

Las consultas de todas las fuentes se combinan:

  1. Cargar todas las listas de consultas de origen
  2. Eliminar duplicados por texto de consulta normalizado
  3. Fusionar métricas (combinar clics, impresiones, búsquedas)
  4. Rastrear qué fuentes contribuyeron a cada consulta
  5. Ordenar por puntuación de interacción combinada

2.3 Ponderar por Señales de Interacción

Las consultas se puntúan en función de la interacción:

  • Clics de GSC: Peso más alto (interacción directa con nuestro contenido)

  • Clics de Ads: Peso más alto (intención de pago del usuario convertida en acción)

  • Búsquedas en vivo con interacción: Peso medio (interacción en el sitio)

  • Búsquedas en vivo sin interacción: Peso más bajo (solo búsqueda)

  • Autocompletado de Algolia: Peso más bajo (intención incompleta)

  • Ideas de palabras clave: Peso más bajo (sugeridas, no búsquedas observadas)

La fórmula de ponderación es configurable; la interacción es la señal principal de clasificación.

2.4 Filtrar Consultas de Baja Calidad

Se eliminan las consultas no válidas:

  • Spam: Consultas con solo números, caracteres especiales o intentos de inyección

  • Solo marca: Consultas que son solo nuestro nombre de marca solo

  • Puntuación baja: Consultas por debajo del umbral mínimo de interacción

Paso 3: Implementación Técnica

3.1 Proceso de Obtención de Consultas

Autenticación y obtención de datos para cada fuente:

  1. Obtener credenciales (cuenta de servicio, OAuth2 o clave API)
  2. Conectarse a la API respectiva
  3. Solicitar datos para el rango de fechas especificado
  4. Analizar la respuesta en formato JSON estándar
  5. Guardar en almacenamiento local

3.2 Cliente de Google Search Console

Proceso:

  1. Autenticarse con credenciales de cuenta de servicio
  2. Consultar la API de Search Console para el sitio especificado
  3. Paginar a través de los resultados (cada página devuelve hasta 25,000 resultados)
  4. Extraer consulta, clics, impresiones, CTR, posición
  5. Agregar y guardar como JSON

3.3 Cliente de Google Ads

Proceso:

  1. Autenticarse con credenciales OAuth2
  2. Enumerar todas las cuentas autorizadas
  3. Consultar cada cuenta para obtener términos de búsqueda
  4. Agregar métricas entre cuentas
  5. Ordenar por impresiones y guardar

3.4 Análisis de Registros de Consultas en Vivo

Proceso:

  1. Leer archivos de registro de búsqueda internos
  2. Analizar cada entrada del registro (formato JSON, una por línea)
  3. Extraer texto de la consulta y señales de interacción
  4. Eliminar duplicados de consultas y contar ocurrencias
  5. Ponderar por interacción y guardar

3.5 Obtención de Analíticas de Algolia

Proceso:

  1. Autenticarse con credenciales de Algolia
  2. Llamar a la API de Analíticas para datos de búsqueda
  3. Solicitar búsquedas principales con filtro de rango de fechas
  4. Devolver recuento de búsquedas y métricas de resultados
  5. Guardar en formato JSON estándar

Paso 4: Actualizaciones Incrementales

La obtención de consultas admite actualizaciones incrementales para un procesamiento más rápido:

Primera ejecución:

  • Obtener todos los datos históricos (2 años para Ads, 90 días para GSC)

  • Calcular incrustaciones (configuración inicial más lenta)

Ejecuciones posteriores:

  • Obtener solo datos nuevos desde la última ejecución

  • Reutilizar incrustaciones en caché cuando sea posible

  • Las actualizaciones incrementales se completan rápidamente

Lógica de optimización:

  • Verificar si la salida existe y es reciente

  • Omitir si no hay datos nuevos disponibles

  • Reanudar desde el último punto de control en caso de fallo

Paso 5: Integración con la Canalización

Las consultas obtenidas alimentan los pasos posteriores de la canalización:

5.1 Agrupación de Consultas:

  • Entrada: Lista combinada de consultas con pesos de interacción

  • Proceso: Agrupar consultas similares usando incrustaciones

  • Salida: Grupos de consultas para la generación de páginas

5.2 Asignación de Productos:

  • Entrada: Incrustaciones de consultas y grupos

  • Proceso: Asignar cada grupo a productos relevantes

  • Salida: Mapeos de consulta a producto

5.3 Páginas de Consultas:

  • Entrada: Agrupación y asignaciones de productos

  • Proceso: Generar contenido de página para cada grupo

  • Salida: Páginas HTML y datos de enrutamiento

5.4 Búsquedas Relacionadas:

  • Entrada: Incrustaciones de consultas y datos de página

  • Proceso: Encontrar consultas similares para cada página

  • Salida: Sugerencias de búsqueda relacionadas

Ver: Descripción General de la Canalización SEO para la arquitectura completa de la canalización

Consideraciones sobre la Calidad de los Datos

Manejo de Duplicados

Las consultas pueden aparecer en múltiples fuentes con ligeras variaciones. Ejemplo:

  • "mini pc" (GSC)

  • "Mini PC" (Ads)

  • "mini pc" (en vivo con espacio extra)

Solución: Normalizar antes de fusionar (minúsculas, recortar, colapsar espacios en blanco)

Manejo de Spam

Algunas fuentes contienen consultas no válidas:

  • Cadenas de caracteres aleatorios

  • Intentos de inyección SQL

  • Consultas extremadamente largas

Solución: Filtrar por señales de interacción, composición de caracteres, reglas de longitud

Manejo de Estacionalidad

El volumen de consultas varía según la temporada:

  • Mayor volumen durante festivales

  • Menor volumen durante vacaciones

Solución: Usar un período retrospectivo de 90 días para suavizar variaciones estacionales

Características de Rendimiento

  • Tiempo de obtención: Varía según la fuente; la obtención en paralelo reduce el tiempo total

  • Volumen de consultas: Miles a millones dependiendo de las fuentes de datos

  • Tiempo de agregación: Escala con el total de consultas únicas

  • Actualizaciones incrementales: Significativamente más rápidas que la reobtención completa

  • Uso de recursos: CPU moderada para agregación, memoria para eliminación de duplicados

Manejo de Errores

La canalización maneja fallos comunes:

  • API no disponible: Reintentar con retroceso exponencial

  • Datos faltantes: Omitir y registrar; continuar con otras fuentes

  • Entradas no válidas: Filtrar y continuar el procesamiento

  • Fallos parciales: Guardar datos exitosos y posición del punto de control

Ver También

Referencias

APIs y Servicios

Artículos Relacionados


← Volver al Índice de Documentación