Domain Intelligence

Escuta de domínios: como monitorar dados de domínio em escala

blureshot Abril 05, 2026 13 min de leitura 795 visualizações

A maior parte das perguntas sobre a web é, na verdade, uma pergunta sobre mudança. Quais TLDs estão crescendo. Se um CMS está ganhando ou perdendo espaço. Quantos domínios passaram a operar atrás de um determinado CDN neste trimestre. Nenhuma delas se responde com uma única consulta, e nenhuma delas se responde com um único arquivo — todas exigem a mesma população medida duas vezes. Essa prática, tirar snapshots periódicos de dados de domínio e compará-los, é o que este guia chama de escuta de domínios. Não tem glamour, é inteiramente mecânica e é a única forma confiável de enxergar a web se mover.

TL;DR / PRINCIPAIS PONTOS

  • Escuta de domínios significa monitorar uma população de domínios ao longo do tempo comparando snapshots, em vez de consultar nomes individualmente.
  • A unidade de trabalho é um arquivo, não uma consulta. O formato do download varia conforme o pacote e é informado na página do produto.
  • A escala é o ponto central: o pacote da zona .com contém 163,422,083 domínios, a lista do WordPress 21,639,326 e o dataset de todos os domínios registrados 272,614,863 linhas.
  • Os arquivos são gerados no momento da compra, então cada download é um extrato novo, e não um snapshot em cache. É isso que torna significativa a comparação entre períodos.
  • A análise acontece do seu lado. Não há construtor de consultas, nem busca por domínio individual, nem interface de filtros. Você compra um arquivo e o processa com suas próprias ferramentas.
  • Somente dados de domínio: nomes, datas de registro quando publicadas, name servers, MX, IP e tecnologia detectada. Sem contatos pessoais, sem telefones, sem sinais de intenção.
  • O custo de entrada é baixo: pacotes avulsos a partir de $3.50, Pro por $29/mês, Enterprise por $99/mês.

Índice

O que é, de fato, a escuta de domínios

Escuta de domínios é a prática de observar uma população definida de domínios em intervalos repetidos e registrar o que mudou entre eles. Essa população pode ser um TLD inteiro, todos os domínios detectados rodando um determinado CMS ou todos os domínios que apontam para um conjunto específico de name servers. O intervalo pode ser semanal, mensal ou trimestral, conforme a velocidade com que se move o sinal que interessa a você.

A mecânica é a mesma, qualquer que seja o assunto. Você tira um snapshot, armazena, tira outro snapshot mais tarde e calcula três conjuntos: as linhas presentes em ambos, as linhas que apareceram e as que desapareceram. Tudo o que é interessante sai desses três conjuntos. Crescimento é o conjunto das que apareceram. Churn é o conjunto das que desapareceram. Migração é uma linha presente em ambos com um campo alterado.

Essa é uma disciplina diferente da consulta domínio a domínio. WHOIS e RDAP respondem "o que o registro diz sobre este nome agora", e têm limite de requisições justamente para que ninguém os use para enumerar uma população. Um arquivo de zona ou uma lista de tecnologia é a população, entregue como arquivo. O que se perde é a imediatez: você não consegue fazer uma pergunta a um arquivo antes de carregá-lo, mas, uma vez carregado, dá para fazer perguntas que nenhum protocolo de consulta jamais vai responder.

Daí decorrem duas consequências práticas. Primeira: disciplina de armazenamento importa mais do que esperteza nas consultas — se você jogar fora o arquivo do trimestre passado, não tem como recuperar o estado daquele trimestre. Segunda: a comparação só é válida se os dois snapshots foram produzidos da mesma forma. Comparar um extrato novo com a cópia em cache desatualizada de um fornecedor mede a política de cache do fornecedor, não a web.

O que você pode medir com snapshots

Tudo o que vem a seguir pode ser respondido a partir de dois ou mais snapshots do mesmo pacote. Nada disso exige dados de contato nem uma interface de consulta.

Crescimento e churn de TLDs

Compare um arquivo de zona com uma cópia anterior dele mesmo. As linhas novas são registros que apareceram na zona; as linhas ausentes são nomes que saíram. Agregue por mês e você terá uma tendência de registros daquele TLD que não depende das estatísticas publicadas por ninguém.

Participação de mercado das plataformas ao longo do tempo

Os pacotes de tecnologia agrupam domínios pela plataforma detectada neles. Contar as linhas do pacote WordPress em dois momentos distintos dá um número absoluto de movimento. Fazer a mesma contagem para várias plataformas e normalizar pelo arquivo de zona de um TLD dá a participação dentro daquele TLD. Essa é uma das poucas formas de dimensionar a presença de uma plataforma sem depender dos números de marketing da própria plataforma.

Migração de infraestrutura

Quando um dataset traz campos de name server, MX ou IP, uma linha presente nos dois snapshots com valor alterado é um evento de migração. Agregados, esses eventos mostram quais provedores de DNS, provedores de e-mail e redes de hospedagem estão ganhando domínios e quais estão perdendo.

Dimensionamento da população antes de construir

Antes de dedicar esforço de engenharia a uma integração ou a um produto de nicho, a contagem de linhas de um pacote de tecnologia é um limite superior direto do conjunto endereçável de sites. Esse número é um fato sobre o arquivo, não uma projeção.

Pesquisa e superfície de exposição

A pesquisa em segurança costuma começar com "quais domínios resolvem para este bloco de IPs" ou "quais domínios rodam esta plataforma". Arquivos em massa respondem às duas perguntas como um filtro sobre uma coluna. O que eles não dizem é a versão do software nem o nível de patch — isso exige sondar os hosts por conta própria, e os arquivos são a lista-alvo desse trabalho, não um substituto para ele.


Comece a escutar.
1,538 pacotes — 716 arquivos de zona de TLDs, 79 listas de tecnologia, 27 datasets. O formato do download varia conforme o pacote e é informado na página do produto.
Explore o catálogo → | Ver preços →


O que há nos arquivos

O catálogo tem três grupos:

As colunas dependem do pacote. Um arquivo de zona é enxuto; um dataset resolvido traz os campos de DNS e IP. A tabela abaixo descreve o formato dos dados, sem garantir que toda coluna esteja em todo pacote — cada anúncio mostra a própria contagem de linhas e o próprio conteúdo antes da compra.

Campo Valor de exemplo Onde aparece
domain example.com Todos os pacotes
created / data de registro 2014-03-18 Quando o registro publica esse dado
ns ns1.cloudflare.com Arquivos de zona, datasets
mx aspmx.l.google.com Datasets com dados de e-mail
ip 93.184.216.34 Datasets de domínios resolvidos
cms / tecnologia WordPress Pacotes de tecnologia

O que os arquivos não contêm: nomes de pessoas, endereços de e-mail, telefones, dados firmográficos ou sinais comportamentais de intenção. A WebTrackly publica dados de domínio. Os dados pessoais do titular são omitidos no nível do registro para a maioria dos domínios por causa do GDPR, e não fazem parte do produto.

Como comprar e processar um pacote

  1. Escolha o pacote. Navegue pelo catálogo ou vá direto para /zones/, /domaindata/ ou /datasets/. Cada anúncio informa a contagem de linhas.
  2. Compre. As compras avulsas começam em $3.50. O Pro custa $29/mês (50 pacotes, 10 datasets, 30,000 chamadas de API); o Enterprise, $99/mês (200 pacotes, 50 datasets, 300,000 chamadas de API). Veja os preços.
  3. Baixe. O ZIP é produzido sob demanda e fica disponível imediatamente após o pagamento.
  4. Processe localmente. Descompacte e trabalhe com o CSV no seu próprio ambiente.

Com contagens de linhas desse tamanho, ferramentas de streaming superam de longe as que carregam tudo em memória:

unzip wordpress-domains.zip
wc -l wordpress-domains.csv

# top name servers, straight from the CSV
duckdb -c "SELECT ns, count(*) AS n FROM 'wordpress-domains.csv'
           GROUP BY ns ORDER BY n DESC LIMIT 20"

Para qualquer coisa que você pretenda consultar repetidamente, carregue uma vez no PostgreSQL ou no ClickHouse e indexe as colunas usadas nos filtros. Juntar dois pacotes — uma lista de tecnologia com um arquivo de zona, por exemplo — é um join pela coluna de domínio.

Como montar um fluxo de diff

Uma configuração de monitoramento tem três partes: uma convenção de nomes, um lugar para guardar os snapshots e uma etapa de diff.

Nomeie por pacote e data. com-zone-2026-07.csv, wordpress-2026-07.csv. A data é a do download, não a da análise.

Guarde os arquivos brutos. CSV compactado é barato, e um snapshot apagado não pode ser gerado de novo retroativamente — o arquivo reflete o estado no momento em que foi produzido.

Faça o diff pela coluna-chave. Para uma análise de apareceu/desapareceu, a comparação ordenada já basta:

cut -d, -f1 wordpress-2026-06.csv | sort -u > old.txt
cut -d, -f1 wordpress-2026-07.csv | sort -u > new.txt

comm -13 old.txt new.txt > appeared.txt   # in new, not in old
comm -23 old.txt new.txt > disappeared.txt # in old, not in new
wc -l appeared.txt disappeared.txt

Para detectar mudanças em nível de campo — um domínio que permaneceu, mas trocou de name server —, faça em SQL:

SELECT n.domain, o.ns AS old_ns, n.ns AS new_ns
FROM new_snapshot n
JOIN old_snapshot o USING (domain)
WHERE n.ns IS DISTINCT FROM o.ns;

Dois cuidados. Normalize antes de comparar: coloque o domínio em minúsculas, remova pontos finais e defina uma única codificação para nomes internacionalizados, ou você vai fabricar um churn que não existe. E trate um único intervalo como ruído — o sinal útil é a tendência ao longo de vários intervalos, não o delta entre dois arquivos arbitrários.

Automatizando com a API do catálogo

As assinaturas incluem acesso à API para trabalhar com o catálogo de forma programática — listar pacotes e datasets e ler seus metadados. O Pro inclui 30,000 chamadas por mês; o Enterprise, 300,000. A API é uma interface de catálogo; ela não faz consultas por domínio.

curl -H "Authorization: Bearer YOUR_API_KEY" \
  "https://webtrackly.com/api/v1/packages/?type=zone"

curl -H "Authorization: Bearer YOUR_API_KEY" \
  "https://webtrackly.com/api/v1/packages/?type=technology&q=wordpress"

curl -H "Authorization: Bearer YOUR_API_KEY" \
  "https://webtrackly.com/api/v1/datasets/"

A referência dos endpoints está na página de documentação da API. Um cron mensal que lê o catálogo, baixa os pacotes que você acompanha e os grava em arquivos datados já basta para manter um pipeline de escuta rodando sem supervisão.

Erros comuns na escuta de domínios e como evitá-los

  1. Tirar um snapshot e chamar isso de monitoramento

    • O que dá errado: um único arquivo é baixado e analisado uma vez.
    • Por quê: um único snapshot descreve um estado. Toda pergunta sobre crescimento, churn ou migração exige pelo menos dois.
    • A correção: defina o intervalo antes do primeiro download e guarde todos os arquivos que baixar.
  2. Comparar snapshots que não foram produzidos da mesma forma

    • O que dá errado: um extrato novo é comparado com um arquivo mais antigo de outra fonte ou de outro pacote.
    • Por quê: o delta passa a refletir diferenças de metodologia, e não mudança real.
    • A correção: compare o mesmo pacote consigo mesmo e registre a data de download de cada arquivo.
  3. Pular a normalização antes do diff

    • O que dá errado: diferenças de maiúsculas e minúsculas, pontos finais ou codificação IDN inconsistente produzem enormes conjuntos fantasmas de apareceu/desapareceu.
    • Por quê: a comparação de strings é exata; o mesmo domínio em duas formas são duas linhas.
    • A correção: passe tudo para minúsculas, remova pontos finais e escolha uma única representação IDN no momento da carga.
  4. Carregar centenas de milhões de linhas na ferramenta errada

    • O que dá errado: um CSV de vários gigabytes é aberto em uma planilha ou percorrido linha a linha em uma linguagem de script.
    • Por quê: as contagens de linhas aqui chegam às centenas de milhões. Qualquer coisa que mantenha o arquivo em memória não vai terminar.
    • A correção: processe em streaming — filtros de linha de comando, DuckDB direto sobre o CSV ou uma carga em massa em um banco colunar.
  5. Ler uma detecção de tecnologia como declaração de versão

    • O que dá errado: uma lista de tecnologia é tratada como uma lista de hosts rodando uma versão vulnerável específica.
    • Por quê: os pacotes agrupam domínios por plataforma detectada, não por nível de patch.
    • A correção: use a lista como conjunto-alvo e determine a versão ou a exposição você mesmo, dentro da autorização que seu trabalho exigir.
  6. Esperar que os dados de contato estejam em algum lugar do arquivo

    • O que dá errado: um fluxo de trabalho é desenhado em torno de e-mails ou telefones associados a domínios.
    • Por quê: esses dados não estão nos pacotes, e os dados do titular são omitidos no nível do registro para a maioria dos domínios por causa do GDPR.
    • A correção: use os dados de domínio pelo que eles são — um mapa de nomes, infraestrutura e plataformas — e trate qualquer obtenção de contatos por canais com consentimento e procedência documentados.

Perguntas frequentes

P: O que exatamente a WebTrackly vende?
R: Dados de domínio em massa para download. 1,538 pacotes no total: 716 arquivos de zona de TLDs, 79 listas de tecnologias e CMS e 27 datasets selecionados. O formato do download varia conforme o pacote e é informado na página do produto.

P: Quão atual é um download?
R: O arquivo é gerado no momento da compra, em vez de ser servido a partir de um snapshot pré-montado, então ele reflete o estado dos dados de origem no dia em que você compra.

P: Existe um campo de busca para consultar um domínio específico?
R: Não. Não há consulta por domínio nem interface de filtros. Você escolhe um pacote no catálogo, compra, baixa o CSV e filtra com suas próprias ferramentas.

P: Qual é o tamanho dos arquivos?
R: Varia conforme o pacote. O pacote da zona .com contém 163,422,083 domínios, a lista de tecnologia do WordPress 21,639,326 e o dataset de todos os domínios registrados 272,614,863 linhas. Todo anúncio mostra a contagem de linhas antes da compra.

P: Quanto custa?
R: As compras avulsas de pacotes começam em $3.50. O Pro custa $29/mês e inclui 50 pacotes, 10 datasets e 30,000 chamadas de API. O Enterprise custa $99/mês, com 200 pacotes, 50 datasets e 300,000 chamadas de API. Veja a página de preços para as condições atuais.

P: Os arquivos incluem dados de contato?
R: Não. Nenhum nome, e-mail, telefone ou dado pessoal do titular. Pelo GDPR, esses dados são omitidos nos registros públicos de registro da maioria dos domínios, e estão fora do escopo do que a WebTrackly publica.

P: Existe uma API?
R: Sim, para o catálogo. Ela lista pacotes e datasets e retorna seus metadados, com autenticação por bearer token — veja a documentação da API. Ela não faz consultas de domínio.

P: Como identifico o que mudou entre dois downloads?
R: Normalize a coluna de domínio e depois compare os dois snapshots por ela. As linhas que só estão no arquivo mais novo apareceram; as que só estão no mais antigo desapareceram; as que estão nos dois com um campo alterado são migrações. O comm de linha de comando resolve a comparação de conjuntos, e um join em SQL resolve a detecção de mudanças em nível de campo.

Conclusão

Escuta de domínios não é um recurso de produto, é um hábito: baixar o mesmo pacote em uma periodicidade fixa, guardar todas as cópias e compará-las. O formato do download varia conforme o pacote e é informado na página do produto. O que você recebe em troca é uma medição da web que não depende das estatísticas publicadas por ninguém nem de um protocolo de consulta com limite de requisições.

Escolha a população que interessa a você, tire o primeiro snapshot e comece a contar o tempo.

Tire o primeiro snapshot.
O formato do download varia conforme o pacote e é informado na página do produto.
Explore os pacotes → | Ver preços →

Compartilhar este post

Posts relacionados

Comentários (0)

Deixe um comentário

Ainda não há comentários. Seja o primeiro a comentar!

support_agent
WebTrackly Support
Usually replies within minutes
Olá!
Envie uma mensagem e responderemos o quanto antes.