Para inteligencia competitiva, generación de leads o investigación de seguridad, disponer de una lista precisa de dominios en AWS resulta muy valioso, porque la elección del hosting es un buen indicador del tamaño de la empresa, su madurez técnica y su presupuesto. También es uno de los datos más difíciles de determinar únicamente a partir de datos de dominios, ya que la mayoría de los sitios usa AWS para un servicio concreto —S3, EC2, Route 53, CloudFront— y no como registrador ni como proveedor único.
¿Buscas datos de dominios actualizados? WebTrackly ofrece descargas CSV instantáneas de archivos de zona por TLD, datos de zona enriquecidos con campos NS, MX, IP y CMS, listados de sitios por tecnología y datasets seleccionados, sin necesidad de suscripción.
El reto: identificar dominios alojados en AWS a partir de datos en bruto
No existe ninguna marca de «AWS» en un registro WHOIS. La identificación hay que deducirla, y para ello hay tres señales prácticas, ordenadas de menor a mayor coste.
La más económica es el registro de servidores de nombres. Los dominios que usan Route 53 tienen registros NS que coinciden con la familia ns-XXX.awsdns-XX.com, un patrón trivial de localizar en un archivo de zona. La segunda es la dirección IP: AWS publica sus rangos asignados en un archivo legible por máquina en ip-ranges.amazonaws.com, de modo que resolver un dominio y contrastar el resultado con esos bloques CIDR detecta endpoints de EC2, S3 y CloudFront con independencia de quién gestione el DNS. La tercera y más costosa es la inspección de cabeceras HTTP —Server: AmazonS3 o la presencia de X-Amz-Cf-Id—, que exige una petición real por cada dominio.
Las tres existen porque cada una cubre una población distinta. La coincidencia por servidores de nombres deja fuera todos los dominios que usan Cloudflare o el DNS de un registrador mientras ejecutan su infraestructura en EC2. La coincidencia por IP se pierde los dominios que están detrás de un CDN de terceros que actúa como fachada de un origen en AWS. La inspección de cabeceras detecta esos casos con CDN por delante que las otras dos no ven, pero no puede ejecutarse de forma económica sobre cientos de millones de dominios. Un pipeline serio aplica los filtros baratos a toda la zona y reserva la comprobación de cabeceras para la lista corta.
Origen de los datos: archivos de zona y datos enriquecidos
Los tres métodos parten del mismo punto: una lista de dominios de la zona que te interesa. El catálogo de WebTrackly cubre 716 archivos de zona por TLD y 716 conjuntos enriquecidos equivalentes, con un total de 285.582.781 dominios entre todas las zonas. Solo la zona .com contiene 163.422.083. Los paquetes enriquecidos incluyen campos NS e IP, lo que significa que los dos primeros métodos de identificación se ejecutan directamente sobre el CSV descargado, sin necesidad de hacer consultas DNS propias.
Elijas la vía que elijas, la frescura importa. En el caso concreto del cold email, una lista de dominios vale lo que valga su validación MX, y los registros MX cambian sin previo aviso: vuelve a comprobar la entregabilidad la misma semana en que envíes. WebTrackly exporta cada archivo en el momento de la compra, en lugar de servir una instantánea preconstruida, de modo que los datos reflejan el estado actual de la zona.
El matiz de los ccTLD
Los archivos de zona de ccTLD son bastante más difíciles de obtener que los de gTLD. Muchos registros de código de país nunca publican una zona pública, y otros imponen restricciones de acceso, acuerdos o tarifas que hacen inviable la adquisición directa. El .de alemán y el .fr francés son los ejemplos más conocidos, pero el patrón se repite en buena parte del espacio de códigos de país. Los datos agregados son la única vía viable para cubrir esas zonas, y por eso la disponibilidad por TLD es desigual en todos los proveedores de este mercado.
¿Listo para analizar el hosting con datos de zona reales? WebTrackly ofrece descargas instantáneas de archivos de zona por TLD y datos de zona enriquecidos con campos NS, MX, IP y CMS. Los paquetes desde $3.50.
Filtrar el ruido: dominios recién registrados
Un feed en bruto de dominios recién registrados es ruidoso. Una parte importante de los nuevos registros son dominios aparcados, marcadores de PPC o dominios abandonados a las pocas semanas, así que usar una lista sin filtrar para prospección desperdicia buena parte del esfuerzo. El filtro más rentable es el basado en servidores de nombres: los dominios recién registrados que apuntan a servidores de aparcamiento conocidos como ns1.sedoparking.com pueden descartarse en bloque, sin ninguna petición de red. Los patrones de registrador se correlacionan con esos mismos grupos, así que combinar ambos criterios elimina casi toda la basura en una única pasada offline.
Frescura por encima del volumen
Los volcados de los marketplaces compiten por volumen, pero cuando se trabaja con dominios recién registrados es la antigüedad de los datos la que determina el resultado. Un volcado vendido como «recién registrado» puede haberse compilado meses antes, momento en el que la propiedad interesante —que se trata de negocios en su fase de puesta en marcha— ya no se cumple. Una exportación más pequeña y reciente es mejor punto de partida, y ese es el razonamiento detrás de generar los archivos en el momento de la compra en lugar de entregar un archivo histórico.
Por qué identificar AWS es más difícil de lo previsto
Hay dos complicaciones que aparecen una y otra vez. La primera es el desacoplamiento entre DNS y hosting: un gran número de dominios usa un proveedor DNS de terceros mientras dirige el tráfico a AWS, por lo que la coincidencia por servidores de nombres subestima sistemáticamente la cifra. La solución es correlacionar las IP resueltas con los rangos publicados por AWS, lo que obliga a mantener esos rangos al día: el archivo JSON cambia con regularidad a medida que se añade y se retira capacidad.
La segunda es que los rangos de AWS abarcan muchos servicios con significados distintos. Un dominio que resuelve a un rango de CloudFront te dice que usa un CDN; un dominio que resuelve a un rango de EC2 en una región concreta te dice algo muy distinto sobre dónde se ejecuta realmente la carga de trabajo. Tratar «está en AWS» como un simple booleano tira por la borda la mayor parte de la señal que contienen los datos.
Conclusiones prácticas
- Parte de los datos de zona, no de un crawler. La coincidencia por servidores de nombres e IP sobre un extracto completo de la zona cubre la mayoría de los dominios alojados en AWS a un coste insignificante. Reserva las comprobaciones HTTP para lo que los filtros baratos no logren resolver.
- Mantén actualizados los rangos IP de AWS. Descarga
ip-ranges.jsonde forma programada en lugar de fijar los CIDR en el código. Unos rangos obsoletos generan falsos negativos que parecen ausencias reales. - Segmenta por servicio, no solo por proveedor. Distingue las señales de Route 53, CloudFront, S3 y EC2. «Usa AWS» es un criterio mucho más débil que «ejecuta EC2 en eu-west-1».
- Filtra los dominios recién registrados antes que nada. Descarta primero los servidores de nombres de aparcamiento y los grupos de registros masivos. Todo lo que venga después saldrá más barato.
- Valida los MX justo antes de la prospección. Usa el campo MX del CSV enriquecido para la pasada offline y después un servicio de verificación como ZeroBounce o Email Hippo para la comprobación en vivo. WebTrackly no vende registros de contacto, direcciones de correo ni números de teléfono: solo datos a nivel de dominio.
Preguntas frecuentes
P: ¿Vende WebTrackly una lista de dominios AWS ya preparada?
R: No con la etiqueta «AWS». El catálogo incluye 79 listados de sitios organizados por CMS y tecnología, además de paquetes de zona enriquecidos con campos NS e IP, que son los que filtras contra los patrones de servidores de nombres de AWS y sus rangos IP publicados. La lógica de identificación se queda de tu lado, lo que también significa que permanece bajo tu control conforme cambian los rangos de AWS.
P: ¿Puedo obtener la lista completa de dominios de un TLD concreto?
R: Para los 716 TLD que hay actualmente en el catálogo, sí: consulta zonas para los archivos de zona en bruto y datos de dominios para las versiones enriquecidas. La cobertura de los ccTLD restringidos es intrínsecamente más limitada que la de los gTLD, por los motivos de política de registro descritos más arriba.
P: ¿Cómo se entregan los datos?
El formato de descarga depende del paquete y se indica en la página del producto. El archivo se genera en el momento de la compra. Los paquetes desde $3.50; quien lo use de forma habitual puede optar por Pro a $29/month (50 paquetes, 10 datasets, 30K llamadas de API) o Enterprise a $99/month (200 paquetes, 50 datasets, 300K llamadas de API).
P: ¿Cuál es la mejor forma de filtrar dominios recién registrados para evitar el spam?
R: Filtra primero por patrones de servidores de nombres para eliminar los grupos de aparcamiento, después por registrador y, por último, confirma que el dominio resuelve a algo distinto de una página marcador. Los dos primeros pasos se ejecutan offline sobre el CSV y eliminan casi todo el ruido antes de gastar nada en peticiones de red.
Trabaja con datos de dominios actuales en lugar de volcados obsoletos. WebTrackly entrega 1.538 paquetes —716 archivos de zona por TLD, 716 conjuntos de zona enriquecidos, 79 listados de sitios por tecnología y 27 datasets seleccionados— como descargas CSV instantáneas.