Para inteligência competitiva, geração de leads ou pesquisa de segurança, uma lista de domínios AWS precisa é valiosa porque a escolha de hospedagem funciona como um bom indicador de porte da empresa, maturidade técnica e orçamento. Também é uma das informações mais difíceis de determinar apenas a partir de dados de domínio, porque a maioria dos sites usa a AWS para um serviço específico — S3, EC2, Route 53, CloudFront — e não como registrar ou como único provedor.
Procurando dados de domínio atualizados? A WebTrackly oferece downloads instantâneos em CSV de arquivos de zona de TLDs, dados de zona enriquecidos com campos NS, MX, IP e CMS, listas de sites por tecnologia e datasets selecionados — sem assinatura.
O desafio: identificar domínios hospedados na AWS a partir de dados brutos
Não existe um campo "AWS" em um registro WHOIS. A identificação precisa ser inferida, e há três sinais práticos, em ordem crescente de custo.
O mais barato é o registro de nameserver. Domínios que usam o Route 53 têm registros NS da família ns-XXX.awsdns-XX.com, um padrão trivialmente localizável com grep dentro de um arquivo de zona. O segundo é o endereço IP: a AWS publica as faixas alocadas em um arquivo legível por máquina em ip-ranges.amazonaws.com, então resolver um domínio e testar o resultado contra esses blocos CIDR captura endpoints de EC2, S3 e CloudFront independentemente de quem opera o DNS. O terceiro, e mais caro, é a inspeção de cabeçalhos HTTP — Server: AmazonS3 ou a presença de X-Amz-Cf-Id —, que exige uma requisição real por domínio.
Os três métodos coexistem porque capturam populações diferentes. A correspondência por nameserver deixa de fora todo domínio que usa Cloudflare ou o DNS de um registrar enquanto roda a infraestrutura em EC2. A correspondência por IP não enxerga domínios atrás de um CDN de terceiros que serve como fachada para uma origem na AWS. A inspeção de cabeçalhos captura justamente esses casos com CDN à frente, mas não pode ser executada de forma barata contra centenas de milhões de domínios. Um pipeline sério aplica os filtros baratos em toda a zona e reserva a checagem de cabeçalhos para a lista curta.
Origem dos dados: arquivos de zona e dados enriquecidos
Os três métodos partem do mesmo ponto: uma lista de domínios da zona que interessa a você. O catálogo da WebTrackly cobre 716 arquivos de zona de TLDs e 716 conjuntos enriquecidos correspondentes, totalizando 285.582.781 domínios entre as zonas. Só a zona .com concentra 163.422.083. Os pacotes enriquecidos incluem os campos NS e IP, ou seja, os dois primeiros métodos de identificação rodam direto sobre o CSV baixado, sem nenhuma consulta de DNS da sua parte.
Seja qual for o caminho escolhido, a atualidade dos dados importa. Para cold email, em particular, uma lista de domínios vale o que vale sua validação de MX, e registros MX mudam sem aviso — revalide a entregabilidade na mesma semana do envio. A WebTrackly gera cada arquivo no momento da compra, em vez de entregar um snapshot pré-montado, de modo que os dados refletem o estado atual da zona.
A particularidade dos ccTLDs
Arquivos de zona de ccTLDs são consideravelmente mais difíceis de obter do que os de gTLDs. Muitos registries de código de país nunca publicam uma zona pública, e outros impõem restrições de acesso, contratos ou taxas que tornam a aquisição direta inviável. O .de da Alemanha e o .fr da França são os exemplos mais conhecidos, mas o padrão se repete em boa parte do espaço de códigos de país. Dados agregados são a única rota viável de cobertura para essas zonas, e é por isso que a disponibilidade por TLD é desigual em todos os fornecedores desse mercado.
Pronto para rodar análises de hospedagem sobre dados de zona reais? A WebTrackly oferece downloads instantâneos de arquivos de zona de TLDs e dados de zona enriquecidos com campos NS, MX, IP e CMS. Os pacotes começam em $3.50.
Filtrando ruído: domínios recém-registrados
Um feed bruto de domínios recém-registrados é ruidoso. Boa parte dos novos registros são domínios estacionados, placeholders de PPC ou abandonados em poucas semanas, então usar uma lista bruta para prospecção desperdiça uma fatia considerável do esforço. O filtro de maior rendimento é o baseado em nameserver: domínios recém-registrados apontando para nameservers de parking conhecidos, como ns1.sedoparking.com, podem ser descartados em bloco, sem nenhuma requisição de rede. Padrões de registrar se correlacionam com os mesmos clusters, então combinar os dois elimina a maior parte do lixo em uma única passada offline.
Atualidade acima de volume
Os dumps de marketplace se vendem pelo volume, mas em trabalhos com domínios recém-registrados é a idade dos dados que determina o resultado. Um dump vendido como "recém-registrado" pode ter sido montado meses antes e, a essa altura, a propriedade interessante — a de que são empresas em fase de estruturação — já não se aplica. Um export menor e recente é o melhor insumo, e esse é o raciocínio por trás de gerar os arquivos na compra em vez de despachar um arquivo antigo.
Por que identificar a AWS é mais difícil do que parece
Duas complicações aparecem com frequência. A primeira é o desacoplamento entre DNS e hospedagem: um grande número de domínios usa um provedor de DNS de terceiros enquanto direciona o tráfego para a AWS, então a correspondência por nameserver isoladamente subestima o total de forma sistemática. Correlacionar os IPs resolvidos com as faixas publicadas pela AWS resolve isso — e exige manter essas faixas atualizadas, já que o arquivo JSON muda com regularidade conforme capacidade é adicionada e desativada.
A segunda é que as faixas da AWS abrangem muitos serviços com significados diferentes. Um domínio que resolve para uma faixa do CloudFront indica que ele usa um CDN; um domínio que resolve para uma faixa de EC2 em uma região específica diz algo bem distinto sobre onde a carga de trabalho realmente roda. Tratar "está na AWS" como um único booleano descarta a maior parte do sinal presente nos dados.
Conclusões práticas
- Comece pelos dados de zona, não por um crawler. A correspondência por nameserver e por IP contra um extrato completo da zona cobre a maioria dos domínios hospedados na AWS a um custo irrisório. Reserve as checagens HTTP para o que os filtros baratos não conseguem resolver.
- Mantenha as faixas de IP da AWS atualizadas. Baixe o
ip-ranges.jsonde forma agendada, em vez de fixar os CIDRs no código. Faixas desatualizadas produzem falsos negativos que se parecem com ausência genuína. - Segmente por serviço, não apenas por provedor. Diferencie os sinais de Route 53, CloudFront, S3 e EC2. "Usa AWS" é um qualificador muito mais fraco do que "roda EC2 em eu-west-1".
- Filtre os NRDs antes de qualquer outra coisa. Descarte primeiro os nameservers de parking e os clusters de registro em massa. Tudo o que vem depois fica mais barato.
- Valide o MX imediatamente antes da prospecção. Use o campo MX do CSV enriquecido na passada offline e, em seguida, um serviço de verificação como ZeroBounce ou Email Hippo para a checagem ao vivo. A WebTrackly não vende registros de contato, endereços de e-mail nem telefones — apenas dados em nível de domínio.
Perguntas frequentes
P: A WebTrackly vende uma lista de domínios AWS pronta?
R: Não sob o rótulo "AWS". O catálogo inclui 79 listas de sites organizadas por CMS e tecnologia, além de pacotes de zona enriquecidos com os campos NS e IP, que são justamente o insumo para filtrar por padrões de nameserver da AWS e pelas faixas de IP publicadas. A lógica de identificação fica do seu lado, o que também significa que ela permanece sob seu controle conforme as faixas da AWS mudam.
P: Consigo obter a lista completa de domínios de um TLD específico?
R: Para os 716 TLDs atualmente no catálogo, sim — veja zones para os arquivos de zona brutos e domain data para as versões enriquecidas. A cobertura de ccTLDs restritos é naturalmente mais estreita do que a de gTLDs, pelas razões de política de registry descritas acima.
P: Como os dados são entregues?
O formato do download varia conforme o pacote e é informado na página do produto. O arquivo é gerado no momento da compra. Os pacotes começam em $3.50; quem usa com frequência pode optar pelo Pro a $29/mês (50 pacotes, 10 datasets, 30K chamadas de API) ou pelo Enterprise a $99/mês (200 pacotes, 50 datasets, 300K chamadas de API).
P: Qual a melhor forma de filtrar domínios recém-registrados para evitar spam?
R: Filtre primeiro por padrões de nameserver para remover os clusters de parking, depois por registrar e, então, confirme que o domínio resolve para algo diferente de uma página placeholder. Os dois primeiros passos rodam offline sobre o CSV e removem a maior parte do ruído antes que você gaste qualquer coisa com requisições de rede.
Trabalhe com dados de domínio atuais em vez de dumps velhos. A WebTrackly entrega 1.538 pacotes — 716 arquivos de zona de TLDs, 716 conjuntos de zona enriquecidos, 79 listas de sites por tecnologia e 27 datasets selecionados — como downloads instantâneos em CSV.