Obtención de Consultas: Recopilación de Datos de Búsqueda de Múltiples Fuentes
Este artículo explica cómo recopilamos consultas de búsqueda de cinco fuentes diferentes para construir un conjunto de datos integral para la canalización SEO.
El Problema: Datos de Consultas Incompletos
Depender de una única fuente de datos da una imagen incompleta:
-
Google Search Console: Solo muestra las consultas que generaron clics (se pierden consultas con muchas impresiones y bajo CTR)
-
Google Ads: Solo muestra términos de búsqueda de pago (se pierde el tráfico orgánico)
-
Registros de búsqueda en vivo: Solo muestra búsquedas en el sitio (se pierde el descubrimiento externo)
-
Algolia: Solo muestra consultas de autocompletado (se pierden búsquedas completas)
Necesitamos agregar consultas de todas las fuentes para entender el panorama completo de búsqueda.
Descripción General: Cinco Fuentes de Consultas
La canalización obtiene datos de cinco fuentes:
-
Google Search Console: Consultas de búsqueda orgánica con métricas de interacción
-
Google Ads: Términos de búsqueda de pago con datos de conversión
-
Registros de búsqueda en vivo: Consultas de usuarios en el sitio
-
Analíticas de Algolia: Consultas de búsqueda de autocompletado
-
Keyword Planner: Sugerencias de palabras clave relacionadas
Cada fuente proporciona diferentes perspectivas; combinadas crean un conjunto de datos de consultas integral.
Paso 1: Obtener Consultas de Cada Fuente
1.1 Google Search Console (GSC)
Propósito: Recopilar consultas de búsqueda orgánica que generaron clics.
Entrada: URL del sitio web verificada en Search Console.
Salida: Lista de consultas con métricas de interacción (consultas, clics, impresiones, CTR, posición).
Especificaciones de datos:
-
Texto de la consulta
-
Clics (número de usuarios que hicieron clic en nuestro resultado)
-
Impresiones (número de veces que apareció nuestro resultado)
-
CTR (tasa de clics como porcentaje)
-
Posición promedio en los resultados de búsqueda
Período retrospectivo: 90 días (máximo para datos detallados de consultas)
Filtrado: Mínimo 1 clic (excluye consultas que solo tienen impresiones)
Acceso: API de Google Search Console mediante cuenta de servicio con alcance de solo lectura
1.2 Términos de Búsqueda de Google Ads
Propósito: Recopilar términos de búsqueda de pago que activaron anuncios.
Entrada: Cuenta de Google Ads con acceso de cuenta de administrador.
Salida: Lista de términos de búsqueda con métricas de rendimiento (términos, impresiones, clics, costo).
Especificaciones de datos:
-
Texto del término de búsqueda
-
Impresiones (número de vistas del anuncio)
-
Clics (número de clics en el anuncio)
-
Costo en micros (1 millón de unidades = 1 unidad monetaria)
Período retrospectivo: 2 años (todos los datos históricos disponibles)
Agregación: Combina datos de todas las cuentas autorizadas
Filtrado: Mínimo 1 impresión
Acceso: API de Google Ads mediante OAuth2
1.3 Consultas de Búsqueda en Vivo
Propósito: Recopilar consultas de búsqueda de usuarios en el sitio.
Entrada: Registros de búsqueda internos del servicio de búsqueda.
Salida: Lista de consultas con métricas de frecuencia (consultas, recuentos, interacción).
Especificaciones de datos:
-
Texto de la consulta
-
Frecuencia (número de veces buscada)
-
Datos de interacción (búsquedas que llevaron a interacciones con productos)
Período retrospectivo: Varía (típicamente 30-90 días según la retención de registros)
Ponderación: Las consultas se ponderan por interacción (las búsquedas con interacciones tienen una puntuación más alta)
Filtrado: Eliminar duplicados y contar ocurrencias
1.4 Búsquedas Principales de Algolia
Propósito: Recopilar búsquedas de autocompletado de las analíticas de Algolia.
Entrada: Datos de analíticas de búsqueda de Algolia.
Salida: Lista de consultas de búsqueda principales con frecuencia (búsquedas principales, recuentos).
Especificaciones de datos:
-
Texto de la consulta
-
Recuento de búsquedas (número de veces buscada)
Período retrospectivo: 90 días
Filtrado: Limitar a búsquedas recientes de alto volumen
Acceso: API de Analíticas de Algolia mediante credenciales de aplicación
1.5 Ideas de Keyword Planner
Propósito: Recopilar sugerencias de palabras clave relacionadas.
Entrada: Palabras clave semilla (categorías de productos, familias, términos de búsqueda comunes).
Salida: Lista de palabras clave con métricas (palabras clave, volumen de búsqueda, competencia, sugerencias de oferta).
Especificaciones de datos:
-
Texto de la palabra clave
-
Búsquedas mensuales promedio
-
Nivel de competencia (bajo, medio, alto)
-
Valor de oferta sugerido
Filtrado: Solo palabras clave relevantes (excluir sugerencias no relacionadas)
Acceso: API de Keyword Planner de Google Ads mediante OAuth2
Paso 2: Normalizar y Agregar Consultas
2.1 Normalizar el Texto de la Consulta
Las consultas se estandarizan antes de la agregación:
-
Convertir a minúsculas
-
Normalizar espacios en blanco (colapsar múltiples espacios a uno solo)
-
Recortar espacios en blanco iniciales/finales
-
Eliminar caracteres especiales (cuando sea aplicable)
2.2 Combinar y Eliminar Duplicados
Las consultas de todas las fuentes se combinan:
- Cargar todas las listas de consultas de origen
- Eliminar duplicados por texto de consulta normalizado
- Fusionar métricas (combinar clics, impresiones, búsquedas)
- Rastrear qué fuentes contribuyeron a cada consulta
- Ordenar por puntuación de interacción combinada
2.3 Ponderar por Señales de Interacción
Las consultas se puntúan en función de la interacción:
-
Clics de GSC: Peso más alto (interacción directa con nuestro contenido)
-
Clics de Ads: Peso más alto (intención de pago del usuario convertida en acción)
-
Búsquedas en vivo con interacción: Peso medio (interacción en el sitio)
-
Búsquedas en vivo sin interacción: Peso más bajo (solo búsqueda)
-
Autocompletado de Algolia: Peso más bajo (intención incompleta)
-
Ideas de palabras clave: Peso más bajo (sugeridas, no búsquedas observadas)
La fórmula de ponderación es configurable; la interacción es la señal principal de clasificación.
2.4 Filtrar Consultas de Baja Calidad
Se eliminan las consultas no válidas:
-
Spam: Consultas con solo números, caracteres especiales o intentos de inyección
-
Solo marca: Consultas que son solo nuestro nombre de marca solo
-
Puntuación baja: Consultas por debajo del umbral mínimo de interacción
Paso 3: Implementación Técnica
3.1 Proceso de Obtención de Consultas
Autenticación y obtención de datos para cada fuente:
- Obtener credenciales (cuenta de servicio, OAuth2 o clave API)
- Conectarse a la API respectiva
- Solicitar datos para el rango de fechas especificado
- Analizar la respuesta en formato JSON estándar
- Guardar en almacenamiento local
3.2 Cliente de Google Search Console
Proceso:
- Autenticarse con credenciales de cuenta de servicio
- Consultar la API de Search Console para el sitio especificado
- Paginar a través de los resultados (cada página devuelve hasta 25,000 resultados)
- Extraer consulta, clics, impresiones, CTR, posición
- Agregar y guardar como JSON
3.3 Cliente de Google Ads
Proceso:
- Autenticarse con credenciales OAuth2
- Enumerar todas las cuentas autorizadas
- Consultar cada cuenta para obtener términos de búsqueda
- Agregar métricas entre cuentas
- Ordenar por impresiones y guardar
3.4 Análisis de Registros de Consultas en Vivo
Proceso:
- Leer archivos de registro de búsqueda internos
- Analizar cada entrada del registro (formato JSON, una por línea)
- Extraer texto de la consulta y señales de interacción
- Eliminar duplicados de consultas y contar ocurrencias
- Ponderar por interacción y guardar
3.5 Obtención de Analíticas de Algolia
Proceso:
- Autenticarse con credenciales de Algolia
- Llamar a la API de Analíticas para datos de búsqueda
- Solicitar búsquedas principales con filtro de rango de fechas
- Devolver recuento de búsquedas y métricas de resultados
- Guardar en formato JSON estándar
Paso 4: Actualizaciones Incrementales
La obtención de consultas admite actualizaciones incrementales para un procesamiento más rápido:
Primera ejecución:
-
Obtener todos los datos históricos (2 años para Ads, 90 días para GSC)
-
Calcular incrustaciones (configuración inicial más lenta)
Ejecuciones posteriores:
-
Obtener solo datos nuevos desde la última ejecución
-
Reutilizar incrustaciones en caché cuando sea posible
-
Las actualizaciones incrementales se completan rápidamente
Lógica de optimización:
-
Verificar si la salida existe y es reciente
-
Omitir si no hay datos nuevos disponibles
-
Reanudar desde el último punto de control en caso de fallo
Paso 5: Integración con la Canalización
Las consultas obtenidas alimentan los pasos posteriores de la canalización:
5.1 Agrupación de Consultas:
-
Entrada: Lista combinada de consultas con pesos de interacción
-
Proceso: Agrupar consultas similares usando incrustaciones
-
Salida: Grupos de consultas para la generación de páginas
5.2 Asignación de Productos:
-
Entrada: Incrustaciones de consultas y grupos
-
Proceso: Asignar cada grupo a productos relevantes
-
Salida: Mapeos de consulta a producto
5.3 Páginas de Consultas:
-
Entrada: Agrupación y asignaciones de productos
-
Proceso: Generar contenido de página para cada grupo
-
Salida: Páginas HTML y datos de enrutamiento
5.4 Búsquedas Relacionadas:
-
Entrada: Incrustaciones de consultas y datos de página
-
Proceso: Encontrar consultas similares para cada página
-
Salida: Sugerencias de búsqueda relacionadas
Ver: Descripción General de la Canalización SEO para la arquitectura completa de la canalización
Consideraciones sobre la Calidad de los Datos
Manejo de Duplicados
Las consultas pueden aparecer en múltiples fuentes con ligeras variaciones. Ejemplo:
-
"mini pc" (GSC)
-
"Mini PC" (Ads)
-
"mini pc" (en vivo con espacio extra)
Solución: Normalizar antes de fusionar (minúsculas, recortar, colapsar espacios en blanco)
Manejo de Spam
Algunas fuentes contienen consultas no válidas:
-
Cadenas de caracteres aleatorios
-
Intentos de inyección SQL
-
Consultas extremadamente largas
Solución: Filtrar por señales de interacción, composición de caracteres, reglas de longitud
Manejo de Estacionalidad
El volumen de consultas varía según la temporada:
-
Mayor volumen durante festivales
-
Menor volumen durante vacaciones
Solución: Usar un período retrospectivo de 90 días para suavizar variaciones estacionales
Características de Rendimiento
-
Tiempo de obtención: Varía según la fuente; la obtención en paralelo reduce el tiempo total
-
Volumen de consultas: Miles a millones dependiendo de las fuentes de datos
-
Tiempo de agregación: Escala con el total de consultas únicas
-
Actualizaciones incrementales: Significativamente más rápidas que la reobtención completa
-
Uso de recursos: CPU moderada para agregación, memoria para eliminación de duplicados
Manejo de Errores
La canalización maneja fallos comunes:
-
API no disponible: Reintentar con retroceso exponencial
-
Datos faltantes: Omitir y registrar; continuar con otras fuentes
-
Entradas no válidas: Filtrar y continuar el procesamiento
-
Fallos parciales: Guardar datos exitosos y posición del punto de control
Ver También
-
Descripción General de la Canalización SEO — Arquitectura completa de la canalización
-
Agrupación de Consultas — Cómo se agrupan consultas similares
-
Asignación de Productos — Asignar consultas a productos
-
Estrategia de Incrustaciones — Incrustaciones de consultas y productos
-
Generación de Búsquedas Relacionadas — Construir enlaces relacionados
Referencias
APIs y Servicios
-
API de Google Search Console — Documentación oficial
-
API de Google Ads — Documentación oficial
-
API de Analíticas de Algolia — Documentación oficial
Artículos Relacionados
-
Descripción General de la Canalización SEO — Arquitectura completa de la canalización
-
Agrupación de Consultas — Cómo se agrupan las consultas
-
Asignación de Productos — Asignar consultas a productos