Clustering de semántica y parsing de resultados de búsqueda a través de proxies móviles: guía paso a paso
Contenido del artículo
- Introducción
- Preparación previa
- Conceptos básicos
- Paso 1: formamos el núcleo semántico
- Paso 2: conectamos y configuramos los proxies móviles
- Paso 3: configuración de la rotación y las pausas
- Paso 4: parsing de los resultados de búsqueda y recopilación de serp
- Paso 5: clustering según los resultados
- Antibloqueo: reglas para trabajar de forma segura
- Verificación del resultado
- Errores típicos y soluciones
- Posibilidades adicionales
- Faq
- Conclusión
Introducción
En esta guía paso a paso aprenderás cómo recopilar el núcleo semántico, cómo configurar el parsing de los resultados de búsqueda a través de proxies móviles, cómo realizar el clustering de semántica por intersección de resultados y cómo obtener un archivo final con grupos de consultas listos para tus páginas. La instrucción está diseñada para principiantes con elementos para usuarios avanzados y te dará un resultado seguro y predecible. Obtendrás: una lista de palabras clave, la exportación de SERP para cada clave, clusters agrupados, prioridades para las páginas y archivos listos para contenido y especificaciones técnicas.
Esta guía es adecuada para especialistas en SEO, content marketers, propietarios de sitios web, analistas, así como para todos aquellos que quieran entender cómo funciona el clustering de semántica en la práctica sin teoría innecesaria.
Previamente es útil conocer lo básico: qué son las palabras clave, cómo trabajar con tablas, cómo guardar archivos CSV. Incluso si no tienes experiencia, hemos previsto pasos extremadamente detallados.
Tiempo estimado: para un recorrido rápido con listas de claves listas, dedicarás de 3 a 5 horas. Para un ciclo completo desde cero, de 1 a 2 días hábiles considerando el parsing, clustering y verificación.
Preparación previa
Antes de comenzar, reúne las herramientas y accesos para no distraerte durante la ejecución.
Herramientas, programas y accesos necesarios
- Computadora con Windows 10 o superior, macOS 12+ o Linux Ubuntu 20.04+.
- Editor de hojas de cálculo: Google Sheets o Excel 2019+.
- Herramienta para recopilar palabras clave y parsear SERP: Key Collector o un parser de escritorio similar. Más detalles en el material interno sobre Key Collector: Material sobre Key Collector.
- Cuenta de un proveedor de proxies móviles. En esta guía nos centraremos en mobileproxy.space como ejemplo claro.
- Navegador Chrome, Edge o Firefox con versión actualizada.
Requisitos del sistema
- 4 GB de RAM para trabajar cómodamente con proyectos pequeños, 8 GB+ para listas grandes de palabras clave (50 000+).
- Espacio libre en disco: 2-5 GB para exportaciones y copias de seguridad.
- Internet estable: desde 10 Mbps, sin demoras significativas.
Qué descargar, instalar y configurar
- Instala el parser elegido (por ejemplo, Key Collector). Ejecuta el programa y completa el proceso de activación.
- Prepara una carpeta para el proyecto, por ejemplo: D:\SEO\Project\Semantics. Dentro, crea subcarpetas input, serp, clusters, backups.
- Crea un archivo de semántica input\keywords_raw.csv. Al inicio, basta con una columna: keyword.
- Crea una cuenta en el proveedor de proxies móviles. En el panel de administración, crea un punto de acceso, obtén la dirección del proxy, puerto, usuario y contraseña, o configura la autorización por IP.
Copias de seguridad
Cada vez que completes una etapa (recopilar palabras clave, parsear SERP, hacer clustering), guarda una copia de seguridad en la carpeta backups con la fecha y hora en el nombre.
Consejo: Nombra los archivos de forma clara: keywords_2026-06-22.csv, serp_top10_2026-06-22.csv, clusters_v1_2026-06-22.xlsx. Así podrás volver fácilmente a la versión deseada.
⚠️ Atención: No guardes los accesos a los proxies en un documento abierto. Usa un gestor de contraseñas o notas encriptadas.
Conceptos básicos
Términos clave explicados de forma sencilla
- Núcleo semántico — lista de frases clave por las que los usuarios buscan tus productos o servicios.
- Clustering de semántica — agrupación de consultas con significado similar en clusters, de modo que cada grupo corresponda a una página del sitio.
- Parsing de resultados de búsqueda (SERP) — obtención automática de los mejores resultados para cada palabra clave.
- Proxies móviles — proxies que utilizan direcciones IP de operadores móviles. Suelen cambiar con frecuencia y aparecen ante los buscadores como usuarios móviles normales.
Principios básicos de funcionamiento
- Recopilamos palabras clave de cualquier forma conveniente.
- Parseamos los mejores resultados para cada palabra a través de proxies móviles, respetando límites y pausas.
- Comparamos las intersecciones de resultados y agrupamos las palabras clave en clusters.
Qué es importante entender antes de empezar
- Respeta las reglas y condiciones de los servicios. Trabaja con cuidado, con pausas y limitaciones de solicitudes.
- Usa únicamente fuentes de datos permitidas. Si es necesario, utiliza API oficiales o funciones de exportación.
Consejo: Para mayor estabilidad, mantén baja y uniforme la frecuencia de solicitudes, y programa las tareas en periodos de menor carga.
Paso 1: Formamos el núcleo semántico
Objetivo de la etapa
Obtener una lista limpia de palabras clave en formato CSV con una frase por línea.
Instrucciones
- Abre Key Collector y crea un nuevo proyecto. Haz clic en Archivo, luego Nuevo proyecto, indica la carpeta del proyecto y el nombre, por ejemplo Project_Semantics.kc.
- Añade las palabras clave iniciales: haz clic en Añadir frases, pega la lista desde el portapapeles o impórtala desde el archivo input\keywords_raw.csv.
- Configura la región y el motor de búsqueda: abre Configuración del proyecto, selecciona la región y el idioma deseados. Por ejemplo, Yandex Rusia o Google Rusia.
- Elimina duplicados: haz clic en Operaciones, luego Eliminar duplicados. Confirma la eliminación.
- Limpia basura: elimina frases claramente no relevantes. Usa filtros por palabras vacías si las has preparado de antemano.
- Guarda el archivo: Archivo, Guardar, verifica que Project_Semantics.kc esté actualizado. Exporta la lista actual a input\keywords_clean.csv mediante Archivo, Exportar, CSV.
Consejo: Si es tu primera vez usando Key Collector, revisa el análisis interno de funciones en el material: Material sobre Key Collector. Allí encontrarás plantillas de filtros listas.
✅ Verificación: En la carpeta input debe aparecer el archivo keywords_clean.csv con una columna keyword y al menos 50-100 líneas.
Posibles problemas y soluciones
- Problema: hay muchas formas de palabras iguales en la lista. Causa: no se aplicó lematización ni normalización. Solución: en la etapa de filtrado, agrupa por forma base, o deja todas las variantes; no es crítico para el clustering por SERP.
- Problema: el archivo CSV no se abre. Causa: codificación o separador. Solución: al exportar, elige UTF-8 y separador coma o punto y coma, luego repite la exportación.
Paso 2: Conectamos y configuramos los proxies móviles
Objetivo de la etapa
Conectar los proxies móviles y asegurarse de que las solicitudes del parser pasen a través de ellos.
Instrucciones
- Accede al panel de administración del proveedor de proxies móviles. En el ejemplo de mobileproxy.space, crea un nuevo canal de proxy. Selecciona país y operador si es necesario.
- Obtén los parámetros: dirección del proxy (host), puerto, usuario y contraseña. Si se usa autorización por IP, añade tu IP blanca en la configuración.
- Abre tu parser. En Key Collector, ve a Configuración, sección Proxy.
- Añade el proxy: haz clic en Añadir, indica el formato http://usuario:contraseña@host:puerto o host, puerto y credenciales en campos separados.
- Marca la casilla Usar proxy para solicitudes al motor de búsqueda. Guarda la configuración.
- Prueba la conexión: haz clic en Probar proxy. Asegúrate de que el estado sea Exitoso y se muestre una IP del operador móvil.
Consejo: Si el proveedor proporciona un enlace de Cambio rápido de IP, guárdalo. Será útil para la rotación manual desde el parser o un programador de tareas externo.
⚠️ Atención: No uses proxies gratuitos y desconocidos. Es un riesgo de fuga de datos y pérdida de tiempo por inestabilidad.
✅ Verificación: En la ventana de prueba del proxy ves el estado verde. Al abrir el sitio what is my ip mediante la prueba integrada, se ve una IP móvil.
Posibles problemas y soluciones
- Problema: la prueba del proxy no pasa. Causa: contraseña incorrecta o puerto bloqueado. Solución: verifica usuario y contraseña, consulta las instrucciones del proveedor, prueba con otro puerto.
- Problema: la IP no cambia. Causa: la rotación no está activada o se eligió un canal fijo. Solución: configura la rotación en el panel del proveedor.
Paso 3: Configuración de la rotación y las pausas
Objetivo de la etapa
Reducir la carga en los motores de búsqueda y disminuir la probabilidad de restricciones mediante una frecuencia razonable de solicitudes y rotación de IP.
Instrucciones
- Abre el panel de administración de los proxies móviles. Busca la sección Rotación o Cambiar IP.
- Elige el método de rotación: por tiempo (por ejemplo, cada 2-5 minutos) o por enlace (llamada manual para cambiar IP). Para un parsing estable, comienza con rotación cada 3 minutos.
- Activa el cambio seguro de IP con una breve pausa entre cambios, si está disponible. Esto reduce la probabilidad de cortes de conexión.
- En el parser, define las pausas entre solicitudes: en Key Collector abre Configuración, Motores de búsqueda, indica una pausa entre solicitudes de 5-12 segundos aleatoriamente. Activa la variación aleatoria si existe la opción.
- Limita los hilos a 1-2 simultáneos. Al inicio, usa 1 hilo; luego puedes aumentar a 2 si hay pocos errores.
- Indica un tiempo de espera de respuesta de 30-45 segundos. Si la red es inestable, auméntalo a 60 segundos.
Consejo: Cuantas más palabras clave y más agresivas sean las solicitudes, mayor será el riesgo de recibir un captcha. Mantén la frecuencia a nivel de comportamiento humano: lento y uniforme.
✅ Verificación: Ejecuta una prueba corta con 10 palabras clave. En los registros verás pausas entre solicitudes y respuestas exitosas sin errores de captcha o bloqueos.
Posibles problemas y soluciones
- Problema: tiempos de espera frecuentes. Causa: tiempo de espera demasiado corto o canal sobrecargado. Solución: aumenta el tiempo de espera, reduce los hilos a uno.
- Problema: captchas periódicos. Causa: alta intensidad de solicitudes. Solución: aumenta la pausa y el intervalo de rotación, distribuye la tarea en más tiempo.
Paso 4: Parsing de los resultados de búsqueda y recopilación de SERP
Objetivo de la etapa
Obtener para cada palabra clave los mejores resultados de búsqueda para luego agrupar por intersecciones.
Instrucciones
- Importa las palabras clave limpias desde el archivo input\keywords_clean.csv al parser. En Key Collector, haz clic en Importar, CSV, asigna la columna keyword.
- Abre el módulo de recopilación de topes. En Key Collector, selecciona las herramientas para obtener los top-10 o top-20 resultados para cada palabra clave. Indica el motor de búsqueda y la región como en la configuración del proyecto.
- Activa el uso de proxies. Verifica que la opción esté activa específicamente para el bloque de recopilación de topes.
- Elige la profundidad de los resultados. Se recomienda top-10 para un clustering rápido. Para mayor precisión, puedes recopilar top-20, pero aumentará el tiempo.
- Inicia la recopilación. Haz clic en Iniciar y observa los registros. Asegúrate de que las solicitudes sean uniformes y el programa haga pausas según la configuración.
- Al finalizar, exporta los resultados a serp\serp_top10.csv. Verifica que el archivo tenga las columnas: keyword, position, url, domain.
Consejo: Si trabajas en paralelo con otras tareas, reduce la prioridad del proceso del parser en el administrador de tareas. Así el sistema se mantendrá receptivo.
✅ Verificación: Abre serp_top10.csv y asegúrate de que para cada keyword haya 10 líneas con URL y dominios. Verifica manualmente 2-3 palabras clave en el navegador: los topes deben coincidir en dominios y aproximadamente en posiciones.
Posibles problemas y soluciones
- Problema: no se genera el archivo de exportación. Causa: sin permisos de escritura en la carpeta. Solución: ejecuta el programa como administrador o elige otra carpeta del proyecto.
- Problema: para algunas palabras clave no hay resultados. Causa: exceso de límites o errores temporales de conexión. Solución: reinicia la recopilación solo para las omitidas, aumenta las pausas.
Paso 5: Clustering según los resultados
Objetivo de la etapa
Agrupar las frases clave en clusters basados en la similitud de los resultados de búsqueda, de modo que cada grupo corresponda a una posible página del sitio.
Enfoque 1: Clustering simple en Google Sheets o Excel
- Importa el archivo serp\serp_top10.csv a la hoja de cálculo. Asegúrate de que las columnas keyword y domain estén presentes.
- Crea una tabla dinámica: filas — keyword, valores — lista de domain o cantidad de repeticiones de dominios.
- Al lado, crea una columna TopDomain. Para cada keyword, determina el dominio que aparece con más frecuencia en su top-10. Puedes usar fórmulas para contar la frecuencia.
- Agrupa las palabras clave por el mismo TopDomain. Este es un cluster básico cuando los resultados son muy similares en dominios.
- Adicionalmente, establece un umbral: si un dominio aparece en el top-10 al menos 3 veces, agrupa esas palabras clave en un cluster común.
- Asigna un identificador de cluster: cluster_id en formato CL-001, CL-002, etc. Asocia a cada cluster una palabra clave principal: la más frecuente o la más precisa.
Enfoque 2: Clustering avanzado por intersección de SERP
- Prepara una matriz de intersecciones: para cada par de palabras clave, cuenta el número de dominios comunes en sus top-10.
- Calcula el coeficiente de Jaccard: divide la intersección de dominios entre la unión de dominios de los dos resultados. Es un indicador de similitud de 0 a 1.
- Elige un umbral de similitud, por ejemplo 0.2-0.3 para un clustering suave o 0.4-0.5 para uno estricto.
- Agrupa las palabras clave en un mismo cluster si su similitud es igual o superior al umbral. Trabaja de forma iterativa: comienza con un umbral estricto y ve reduciéndolo si hay demasiadas palabras clave aisladas.
- Marca los clusters y añade la página de destino si ya existe en el sitio, o asigna una URL futura.
Enfoque 3: Uso de servicios especializados
Puedes usar servicios especializados de clustering donde indicas la lista de palabras clave y obtienes los clusters automáticamente. Este camino es más rápido, pero asegúrate de configurar correctamente la región y la profundidad del análisis. Si es necesario, conecta los proxies móviles desde tu parser, y realiza el clustering en el servicio.
Finalización de los clusters
- Recopila la tabla final clusters\clusters_ready.xlsx con las columnas: cluster_id, main_keyword, keywords_list, target_url, priority.
- Asigna una prioridad: High para clusters con alto valor comercial y gran volumen, Medium para los intermedios, Low para los auxiliares.
Consejo: Si tienes dudas, verifica manualmente 2-3 palabras clave del cluster: abre sus SERP y comprueba que los resultados sean similares.
✅ Verificación: En el archivo clusters_ready.xlsx no hay palabras clave aisladas sin cluster, y cada cluster contiene consultas agrupadas de forma lógica.
Posibles problemas y soluciones
- Problema: clusters demasiado dispersos. Causa: umbral de similitud bajo. Solución: aumenta el umbral de Jaccard o el número requerido de dominios comunes.
- Problema: clusters demasiado grandes. Causa: reglas demasiado laxas. Solución: divide por intención, frecuencia o palabras calificativas.
Antibloqueo: reglas para trabajar de forma segura
Cómo minimizar los riesgos
- Respeta pausas razonables y bajo paralelismo. Es el factor principal de estabilidad.
- Planifica el parsing durante un período prolongado, no de una sola vez.
- Supervisa los registros de errores. Si aparece un captcha, reduce la intensidad o haz una pausa.
- Cambia periódicamente el User-Agent dentro de las opciones permitidas de tu parser, si está previsto.
- Usa proxies móviles de un proveedor confiable con reglas transparentes, como mobileproxy.space.
⚠️ Atención: Respeta siempre los acuerdos de usuario y la legislación. Si el sitio proporciona una API oficial o exportación, úsalos de forma prioritaria.
Consejo: Guarda los registros de solicitudes y resultados en archivos separados por fechas. Esto ayudará a resolver incidentes rápidamente y reconstruir pasos.
Verificación del resultado
Lista de verificación
- Existe el archivo input\keywords_clean.csv sin duplicados.
- Existe el archivo serp\serp_top10.csv con la estructura correcta.
- Existe el archivo clusters\clusters_ready.xlsx con clusters y prioridades.
- El parser ejecuta de forma estable una prueba de 10-20 palabras clave sin errores críticos.
- Los proxies móviles están probados, la rotación funciona por tiempo o enlace.
Cómo probar
- Selecciona 5 palabras clave al azar de clusters_ready.xlsx.
- Verifica manualmente los resultados de búsqueda para esas palabras y comprueba que los sitios en el top sean similares para cada cluster.
- Compara las palabras clave dentro del cluster. Deben responder a una misma intención: comprar, comparar, instrucción, etc.
Consejo: Registra métricas antes y después: volumen de semántica, número de clusters, proporción de consultas aisladas. Esto será útil para iteraciones.
✅ Verificación: Si la coincidencia de los resultados y la lógica de agrupación se confirman manualmente en al menos el 80% de los ejemplos, la etapa se ha completado con éxito.
Errores típicos y soluciones
- Problema: rápido aumento de captchas y bloqueos → Causa: alta frecuencia de solicitudes y falta de rotación → Solución: reduce los hilos a 1-2, aumenta las pausas a 8-12 segundos, activa la rotación cada 3-5 minutos.
- Problema: el proxy no se aplica en el parser → Causa: formato incorrecto del proxy o opción desactivada → Solución: usa el formato http://usuario:contraseña@host:puerto y activa la casilla Usar proxy.
- Problema: los archivos de exportación están vacíos → Causa: error de permisos o fallo al exportar → Solución: guarda en la carpeta del proyecto, verifica los permisos y repite la exportación.
- Problema: clusters inconsistentes → Causa: falta de verificación por SERP, agrupación por palabras → Solución: usa la intersección de dominios y el umbral de Jaccard, verifica manualmente el 10% de los clusters.
- Problema: los resultados no coinciden con la búsqueda manual → Causa: región diferente o personalización → Solución: define la región y el idioma exactos, desactiva la personalización en la configuración del parser.
- Problema: la rotación de IP no funciona → Causa: límite de cambios o modo incorrecto → Solución: verifica el plan, activa el cambio por tiempo y prueba el enlace Change IP manualmente.
- Problema: funcionamiento lento → Causa: procesos pesados ejecutándose en paralelo → Solución: cierra aplicaciones innecesarias, reduce los hilos, da más tiempo a la tarea.
Posibilidades adicionales
Configuraciones avanzadas
- Pausas dinámicas: aumenta la pausa tras una serie de respuestas exitosas y redúcela en caso de tiempos de espera poco frecuentes, manteniendo un mínimo seguro.
- Segmentación por intención: complementa los clusters con atributos como tipo de consulta — informacional, transaccional, navegacional.
- Priorización por dificultad: considera la competencia por dominios en los resultados y la autoridad de los sitios principales.
Optimización
- Ejecución por lotes: divide la lista grande de palabras clave en bloques de 500-1000.
- Almacenamiento en caché de resultados: no vuelvas a parsear topes ya conocidos en un período corto si los resultados son estables.
Qué más se puede hacer
- Asignar URLs de destino y crear plantillas de brief para redactores.
- Marcar en los clusters las páginas de la competencia a las que te orientarás en la estructura.
Consejo: Introduce versiones de clusters, por ejemplo v1, v2, y un registro de cambios. Así el equipo entenderá por qué se actualizaron los clusters.
FAQ
1. ¿Por qué se necesitan específicamente proxies móviles para el parsing de resultados?
Los proxies móviles proporcionan direcciones IP dinámicas de operadores móviles y, a menudo, son percibidos por los servicios como tráfico de usuarios reales. Esto aumenta la estabilidad al trabajar con cuidado, con pausas y bajo paralelismo.
2. ¿Se puede parsear más rápido?
Técnicamente sí, pero es más estable y seguro trabajar lento y constante. Es mejor distribuir la tarea y reducir los riesgos de errores o restricciones.
3. ¿Qué hacer si aparece un captcha?
Reduce la frecuencia de solicitudes, aumenta las pausas, haz una pausa y continúa más tarde. Si es posible, usa API oficiales y exportaciones de datos.
4. ¿Qué profundidad de resultados es mejor para el clustering?
Top-10 es suficiente para un clustering básico. Top-20 proporciona más datos para precisión, pero aumenta el tiempo y la carga.
5. ¿Cómo elegir el umbral de similitud?
Comienza con reglas estrictas: intersección de 3+ dominios o Jaccard 0.4-0.5. Si hay demasiadas palabras clave aisladas, reduce el umbral gradualmente.
6. ¿Se puede hacer clustering sin parsear SERP?
Se puede hacer por palabras y lingüística, pero la precisión suele ser menor que al comparar resultados. SERP refleja la intención real de los usuarios y las expectativas del motor de búsqueda.
7. ¿Cómo tener en cuenta la regionalidad?
Parsea estrictamente en la región y el idioma deseados. Para múltiples regiones, realiza exportaciones separadas y forma clusters por cada región por separado.
8. ¿Basta con un proxy móvil?
Sí, para tareas pequeñas. Para listas grandes, es mejor usar varios canales o una rotación más frecuente, pero siempre con pausas cuidadosas.
9. ¿Dónde ver ejemplos paso a paso en Key Collector?
Consulta el material interno: Material sobre Key Collector. Allí se explican plantillas, filtros y exportación.
10. ¿Qué hacer si el parser no es compatible con el proxy?
Verifica el formato del proxy y la configuración de autorización. Si el problema persiste, usa un parser alternativo o configura un proxy a nivel de sistema en los parámetros del SO.
Conclusión
Has completado el ciclo completo: recopilaste las frases clave, conectaste los proxies móviles, configuraste la rotación y las pausas, parseaste los resultados y realizaste el clustering por intersección de SERP. Como resultado, tienes tres artefactos clave: una lista limpia de palabras clave, una exportación de los mejores resultados para cada consulta y una tabla de clusters con prioridades y páginas de destino. A continuación, puedes convertir los clusters en la estructura del sitio, escribir contenido para cada cluster, planificar la interconexión interna y evaluar el potencial de tráfico. Sigue avanzando añadiendo umbrales de similitud avanzados, considerando intenciones y competencia, y automatizando las tareas rutinarias. Al escalar, usa proveedores confiables de proxies móviles, como mobileproxy.space, y mantén siempre un modo de solicitudes cuidadoso.