Arquivos de zona são a base da inteligência de domínios: um retrato de todos os domínios ativos sob um determinado domínio de primeiro nível (TLD), junto com seus registros DNS. Saber obtê-los, interpretá-los e filtrá-los é o que separa um dataset de domínios sobre o qual se pode agir de um arquivo de texto gigante e inútil. Este guia mostra de onde vêm os dados de zona, por que as zonas de código de país são muito mais difíceis de obter do que as genéricas e como reduzir um feed bruto a algo utilizável.
Pronto para trabalhar com dados de zona reais? A WebTrackly oferece bancos de dados de domínios prontos para download: arquivos de zona TLD, dados de zona enriquecidos com campos NS, MX, IP e CMS, listas de sites por tecnologia e datasets selecionados, tudo em downloads CSV avulsos — sem assinatura.
TL;DR
- Feeds brutos de domínios recém-registrados (NRD) são ruidosos — boa parte é de páginas estacionadas ou spam de PPC, então filtrar antes de usar é obrigatório.
- Obter arquivos de zona de ccTLDs é bem mais difícil do que de gTLDs; registries como .de e .fr não publicam nenhuma zona pública, o que obriga a recorrer a dados agregados.
- O valor de uma lista de domínios para cold email cai rápido sem validação de MX — reconfirme a entregabilidade na mesma semana do envio.
- A WebTrackly cobre 716 arquivos de zona TLD e 716 conjuntos de zona enriquecidos, 279,944,703 domínios entre todas as zonas, entregues em CSV dentro de um ZIP.
- Para geração de leads sensível ao tempo, uma exportação recente vale mais do que um dump de marketplace muito maior, porém defasado.
Entendendo o arquivo de zona
Um arquivo de zona é um arquivo de texto simples que lista os nomes de domínio ativos sob um TLD específico junto com seus registros DNS. O arquivo de zona .com, por exemplo, lista todos os domínios .com registrados e seus registros de nameserver (NS) — 163,422,083 domínios na exportação atual da WebTrackly dessa zona. O acesso a arquivos de zona de gTLDs é regido por acordos da ICANN e normalmente exige inscrição, aprovação e compromissos sobre o uso dos dados; a documentação do programa de registries da ICANN descreve esse arcabouço.
O valor de um arquivo de zona está menos no volume e mais na estrutura. Cada entrada traz o nome do domínio, seus nameservers e, às vezes, glue records — os endereços IP de nameservers que ficam dentro do próprio TLD. Isso já basta para rastrear relações de hospedagem, identificar provedores de DNS e agrupar domínios por infraestrutura compartilhada, que é a base de praticamente toda técnica de filtragem que vale a pena usar.
Como obter arquivos de zona: gTLDs vs. ccTLDs
A dificuldade se concentra na obtenção, e a distância entre TLDs genéricos e de código de país é grande.
Arquivos de zona de gTLDs
Para TLDs genéricos como .com, .org ou .info, o processo é padronizado, porém burocrático. Os registries — a Verisign no caso de .com e .net — mantêm programas de acesso a arquivos de zona com processo de inscrição, termos de uso e, em alguns casos, taxas. Os detalhes estão na página de acesso a arquivos de zona da Verisign. A aprovação é só o começo: os arquivos são atualizados diariamente, chegam compactados e precisam ser descompactados, processados e indexados de forma programada. Isso é um compromisso permanente de infraestrutura, não um download único.
Arquivos de zona de ccTLDs: o problema mais difícil
Arquivos de zona de ccTLDs são muito mais difíceis de obter do que os de gTLDs. Muitos registries de código de país simplesmente nunca publicam um arquivo de zona público. O .de da Alemanha e o .fr da França são os exemplos mais conhecidos, ambos alegando privacidade do titular e política nacional. Como os registries de ccTLD não estão sujeitos à política da ICANN da mesma forma que os de gTLD, não existe um programa de acesso centralizado ao qual recorrer — cada registry define seus próprios termos e, em uma parcela considerável deles, a resposta é simplesmente não.
Isso deixa os dados agregados como única rota prática de cobertura para essas zonas. Também significa que a disponibilidade por TLD é irregular em todo provedor desse mercado, inclusive no nosso. Antes de montar um fluxo de trabalho em torno de uma zona de código de país específica, confirme que ela realmente está no catálogo: a WebTrackly publica hoje 716 arquivos de zona TLD, com conjuntos enriquecidos correspondentes em dados de domínios. Para trabalhos com domínios recém-registrados, veja nosso guia sobre como trabalhar com domínios recém-registrados.
Não deixe que registries inacessíveis travem sua pesquisa. A WebTrackly oferece bancos de dados de domínios prontos para download: arquivos de zona TLD, dados de zona enriquecidos, listas de sites por tecnologia e datasets selecionados — CSV dentro de um ZIP, gerado no momento da compra, a partir de $3.50.
Filtrando o ruído: do arquivo de zona bruto à lista acionável
Um arquivo de zona bruto, ou um feed diário de domínios recém-registrados derivado dele, é uma mangueira de incêndio. O desafio não é obter dados, e sim obter dados úteis: grande parte de qualquer feed de NRD é composta por páginas estacionadas e spam de PPC e, sem filtragem agressiva, qualquer prospecção construída sobre isso já nasce fracassada.
Uma metodologia de filtragem
- Reconhecimento de padrões de nameserver. O filtro de maior rendimento. Registros NS apontando para provedores de parking indicam um domínio sem site ativo, e eles se agrupam — um único padrão elimina muitos domínios de uma vez. Isso roda offline sobre um CSV que já contém os campos NS, sem custo além do processamento.
- Filtragem por registrar. Registros em massa e de baixo custo se concentram em um punhado de registrars e têm forte correlação com os clusters de parking acima, de modo que os dois filtros se somam em vez de se repetir.
- Análise de WHOIS. Registros anônimos, endereços de contato genéricos e serviços de privacidade são sinais fracos isoladamente, mas úteis em combinação com os filtros estruturais.
- Análise de tecnologia e conteúdo. Para uma lista curta, verificar em qual plataforma o site roda acrescenta uma forte dimensão de qualificação. A WebTrackly publica 79 listas de sites por tecnologia cobrindo detecção de CMS e plataformas — WordPress com 21,639,326 domínios, Joomla com 607,765, entre outras.
A ordem importa. Rode primeiro os filtros estruturais gratuitos sobre a zona inteira e só depois gaste requisições de rede no que sobreviveu. Inverter essa ordem é a maneira mais comum de transformar uma análise barata em uma análise cara.
Por que dados de zona são mais difíceis do que parecem
Duas coisas costumam surpreender quem chega a esse terreno vindo de um contexto de dados mais genérico.
A primeira é que, no trabalho com domínios recém-registrados, atualidade não é um diferencial desejável — é a premissa inteira. Os NRDs interessam porque representam negócios em fase de montagem, ainda escolhendo fornecedores e tomando decisões. Passada essa janela, a lista vira apenas uma lista de domínios, e o tamanho dela não compensa. É por isso que a WebTrackly gera cada arquivo no momento da compra, em vez de distribuir um pacote pré-montado.
A segunda é que o volume interessante não se restringe aos TLDs tradicionais. gTLDs mais novos como .xyz, .online e .site têm uma proporção de lixo maior que a do .com, mas o volume absoluto de registros é alto o suficiente para que um extrato bem filtrado ainda renda uma lista relevante. Limitar sua cobertura a .com e .net é decidir ignorar boa parte do cenário atual de registros, não um padrão neutro.
Conclusões práticas
- Priorize a atualidade em campanhas com NRDs. Se o alvo são negócios recém-lançados, a idade dos seus dados é a variável que determina o resultado. Trabalhe a partir de uma exportação recente.
- Valide os registros MX antes do cold email. Uma lista de domínios vale o que vale a sua validação de MX — e validação envelhece. Faça a passagem offline no campo MX dos dados de zona enriquecidos e rode verificações ao vivo com um serviço como Hunter.io ou ZeroBounce imediatamente antes do envio. A WebTrackly vende apenas dados em nível de domínio — sem registros de contato, endereços de e-mail ou telefones.
- Não descarte os ccTLDs, mas confira a cobertura antes. A oportunidade de segmentação no espaço de código de país é real, e o problema de acesso aos dados também. Confirme que a zona de que você precisa está disponível antes de desenhar algo em torno dela.
- Filtre no estrutural primeiro, no seletivo depois. Filtros de nameserver e registrar sobre o arquivo inteiro; requisições de rede apenas nos sobreviventes.
- Segmente por tecnologia. Saber que um domínio roda WordPress, Shopify ou Magento torna a abordagem drasticamente mais específica. As listas de sites por tecnologia existem justamente para você não precisar construir a detecção por conta própria.
FAQ
Qual é a diferença entre um arquivo de zona e dados de zona enriquecidos?
Um arquivo de zona lista os domínios sob um TLD junto com seus registros de nameserver — um mapa técnico do que existe. Os dados de zona enriquecidos acrescentam atributos por domínio: campos NS, MX, IP e CMS, que é o que torna a filtragem possível sem manter sua própria infraestrutura de crawling e resolução. A WebTrackly publica 716 pacotes de cada, em zonas e dados de domínios.
Por que arquivos de zona de ccTLDs são mais difíceis de conseguir do que os de gTLDs?
Regulação nacional e autonomia dos registries. Muitos registries de código de país, sobretudo na Europa, priorizam a privacidade do titular e não publicam arquivo de zona completo, frequentemente citando a legislação de proteção de dados. Os grandes registries de gTLD operam sob acordos da ICANN que preveem acesso ao arquivo de zona em termos definidos. Não existe mecanismo central equivalente no espaço de código de país, então os dados agregados são a alternativa prática onde não há acesso direto.
Quão atuais são os dados no momento do download?
Cada arquivo é exportado no momento da compra, e não entregue a partir de um pacote pré-montado, então ele reflete o estado da zona naquele instante. Você recebe um CSV dentro de um ZIP, disponível imediatamente após o pagamento.
Quanto custa?
Os pacotes individuais começam em $3.50, em compras avulsas e sem assinatura. Para uso recorrente há dois planos: Pro a $29/mês, com 50 pacotes e 10 datasets e 30K chamadas de API, e Enterprise a $99/mês, com 200 pacotes e 50 datasets e 300K chamadas de API. As coleções entre zonas — incluindo o dataset completo de todos os domínios, com 272,614,863 linhas — estão listadas em datasets. Veja também nosso guia complementar sobre registros DNS em dados de zona.
Pronto para trabalhar com dados de domínios atuais? A WebTrackly oferece 1,538 pacotes — 716 arquivos de zona TLD, 716 conjuntos de zona enriquecidos, 79 listas de sites por tecnologia e 27 datasets selecionados — como downloads CSV imediatos.