A Índia opera um dos maiores espaços de domínios nacionais do mundo, e o registro por trás dele publica um serviço WHOIS aberto a qualquer consulta. O que esse serviço entrega — e o que ele deixa de entregar — mudou bastante nos últimos anos, e a maioria dos guias ainda o descreve como ele funcionava há uma década. Este artigo explica como o WHOIS do registro .in realmente funciona hoje, quais campos sobrevivem à ocultação, por que a coleta em massa via WHOIS é inviável e como montar um dataset utilizável de domínios indianos a partir de arquivos de zona.
RESUMO / PONTOS-CHAVE
- A NIXI opera o namespace .in: o National Internet Exchange of India administra o .in e seus espaços de segundo nível — .co.in, .net.in, .org.in, .firm.in, .gen.in, .ind.in — além de um conjunto de TLDs internacionalizados para escritas indianas.
- WHOIS é um protocolo de um domínio por vez: cada consulta devolve um registro. Ele tem limite de taxa, às vezes exige CAPTCHA e retorna texto livre que varia conforme o registrar.
- Os campos do titular estão majoritariamente ocultos: nome, e-mail, telefone e endereço postal são suprimidos na maior parte dos domínios. A Digital Personal Data Protection Act, 2023 da Índia reforça esse caminho em vez de revertê-lo.
- O que ainda vem de forma confiável: datas de criação, atualização e expiração, registrar, códigos de status do domínio e servidores de nomes.
- Os arquivos de zona respondem ao que o WHOIS não responde: quais domínios existem, que servidores de nomes e servidores de e-mail usam, para onde resolvem e qual CMS é detectável.
- A WebTrackly distribui esses arquivos: 1.538 pacotes — 716 arquivos de zona por TLD, 716 conjuntos de zona enriquecidos (NS, MX, IP, CMS), 79 listas de sites por tecnologia e 27 datasets curados — cobrindo 285.582.781 domínios no total.
- Sem dados de contato: os pacotes contêm apenas atributos de domínio e de infraestrutura. Nenhum endereço de e-mail, nenhum telefone, nenhuma identidade de titular.
ÍNDICE
- Como funciona o WHOIS do registro .in e o que ele retorna hoje
- Cinco perguntas de pesquisa que os dados de domínios .in respondem
- O que contém um arquivo de dados de zona
- Arquivos em massa vs. consultas WHOIS
- Trabalhando com dados de domínios .in na prática
- Erros comuns ao trabalhar com dados WHOIS do .in
- FAQ: WHOIS do registro .in
- Conclusão
- Recursos relacionados
Como funciona o WHOIS do registro .in e o que ele retorna hoje
O namespace .in é administrado pelo National Internet Exchange of India (NIXI) por meio de sua operação de registro. Ele abrange o segundo nível aberto (example.in) e um conjunto de espaços de segundo nível estruturados, cada um com finalidade prevista: .co.in para entidades comerciais, .net.in para provedores de rede, .org.in para organizações e .firm.in, .gen.in, .ind.in para categorias mais restritas. A NIXI também administra ccTLDs internacionalizados para escritas indianas, ou seja, um retrato completo do espaço de domínios da Índia não se limita à cadeia ASCII ".in".
O registro publica um serviço WHOIS que segue o padrão thin/thick comum aos ccTLDs: o registro do registry carrega os fatos técnicos autoritativos, enquanto o registrar guarda os dados de contato que tenham sido coletados. Ao consultá-lo, você pode contar com um pequeno conjunto de campos sempre presentes e precisos: data de criação, data da última atualização, data de expiração, registrar patrocinador, códigos de status do domínio (clientTransferProhibited, pendingDelete e assim por diante) e os servidores de nomes delegados.
Com o que você não pode mais contar é o bloco de contato. Desde que o GDPR remodelou globalmente a prática de divulgação dos registries, nome do titular, organização, e-mail, telefone e endereço postal são ocultados das respostas públicas na grande maioria dos domínios, substituídos por um marcador ou por um endereço de retransmissão operado pelo registrar. A própria Digital Personal Data Protection Act, 2023 da Índia aponta na mesma direção: dado pessoal de um titular continua sendo dado pessoal, esteja ele ou não dentro de um registro de domínio. Qualquer fluxo de trabalho que pressuponha que o WHOIS público vai entregar uma pessoa para contatar está apoiado em uma premissa que já não se sustenta.
A segunda limitação é mecânica. O WHOIS responde um domínio por consulta. Para perfilar 10.000 domínios, você faz 10.000 consultas — e os registries limitam exatamente esse comportamento: o acesso pela porta 43 tem limite de taxa por IP, e a interface web ainda acrescenta um CAPTCHA. A formatação da resposta varia conforme o registrar, então um parser que funciona em um registro quebra no seguinte. Nada no protocolo foi desenhado para coleta em escala populacional, e nenhuma engenharia em volta disso muda esse fato.
Daí decorre uma divisão de trabalho bastante direta. Use o WHOIS quando você tem um domínio específico e precisa do seu status de registro autoritativo — é nisso que ele é bom. Quando a pergunta é sobre a população — quantos domínios existem, o que rodam, para onde resolvem, como isso muda ao longo do tempo — a resposta vem de dados de zona, distribuídos como arquivos em vez de consultados um registro por vez.
Precisa da lista de domínios, e não de uma consulta?
Explore o catálogo de arquivos de zona — 716 TLDs com a contagem de linhas publicada antes da compra.
Ver zonas → | Ver preços →
Cinco perguntas de pesquisa que os dados de domínios .in respondem
Dados de zona são dados populacionais. Servem para contar, agrupar e comparar ao longo do tempo. Não identificam indivíduos, e nenhum dos fluxos abaixo depende disso.
1. Medir a adoção de CMS e plataformas em um namespace nacional
Os números publicados sobre quais plataformas dominam um determinado país costumam ser extrapolados de uma amostra dos N sites mais populares, o que enviesa fortemente em favor de grandes organizações. Um arquivo de zona com uma coluna de detecção de CMS permite contar diretamente contra um denominador conhecido. Em todo o catálogo da WebTrackly, o WordPress é detectado em 21.639.326 domínios e o Joomla em 567.680; o mesmo cálculo restrito a uma única zona devolve a distribuição daquela zona.
Informe o denominador e a taxa de detecção sempre. "X domínios de um total de Y cobertos, com Z% das linhas trazendo um valor de CMS" é uma afirmação que resiste ao escrutínio. Um percentual solto, não.
2. Mapear provedores de DNS e hospedagem
Os registros de servidores de nomes são o sinal de provedor mais confiável do dataset. Agrupar a coluna NS por sufixo mostra quais operadores de DNS — plataformas globais, hosts regionais, registrars individuais — sustentam a zona, e a distribuição costuma ser bem mais concentrada do que se espera. Os IPs resolvidos acrescentam uma segunda visão, mas exigem interpretação cuidadosa: um site atrás de um CDN publica o endereço do CDN, então as fatias derivadas de IP medem a borda, não a origem.
3. Analisar a infraestrutura de e-mail
Os registros MX dos conjuntos enriquecidos mostram para onde um domínio roteia e-mail. Classifique os hostnames MX por padrão de provedor e você obtém a divisão entre plataformas de e-mail hospedadas, provedores regionais e servidores autogeridos em toda a zona. Comparar dois snapshots separados por alguns meses revela a migração entre eles — que é a pergunta real por trás da maioria das discussões sobre "quem está ganhando em e-mail". Um registro MX é um destino de roteamento, não uma caixa postal: não há endereços nesses arquivos.
4. Acompanhar crescimento e churn
O volume de registros é um proxy amplamente citado de atividade digital, e é uma das poucas coisas que você mesmo consegue medir em vez de tirar de um press release. Compre o mesmo pacote de zona em dois momentos, faça o diff das colunas de domínio e você tem os novos registros e as quedas do intervalo, sem depender das estatísticas divulgadas por ninguém. Guarde e date todo arquivo que baixar; um snapshot descartado é uma comparação que você não pode mais fazer.
5. Pesquisa de segurança e superfície de ataque
Um reconhecimento que parte de consultas WHOIS trava quase de imediato nos limites de taxa. Partir de um arquivo de zona elimina esse teto: filtre localmente o subconjunto que interessa — um CMS, um servidor de nomes, uma faixa de IP — e alimente essa lista nas suas próprias ferramentas de verificação. O arquivo fornece a população; a análise continua sendo sua. Testes ativos devem permanecer dentro do escopo que você está autorizado a testar, e uma lista de domínios disponível para download não é autorização.
O que contém um arquivo de dados de zona
O formato do download varia conforme o pacote e é informado na página do produto. Os pacotes de arquivo de zona contêm a lista de domínios. Os pacotes de zona enriquecidos acrescentam servidores de nomes, registros MX, IPs resolvidos e CMS detectado, preenchidos quando puderam ser determinados e vazios caso contrário.
| domain | ns | mx | ip | cms |
|---|---|---|---|---|
| exampleindia.co.in | ns1.hostinger.in | mx1.hostinger.in | 156.67.x.x | WordPress |
| techsolutions.in | ns-1234.awsdns-56.org | aspmx.l.google.com | 13.234.x.x | |
| mydelhi-store.in | ns1.cloudflare.com | 104.18.x.x | ||
| bengaluru-it.in | ns1.bluehost.in | mail.bengaluru-it.in | 162.241.x.x | Joomla |
| globalexports.in | ns1.vultr.com | mx.zoho.in | 139.84.x.x |
Esse é o esquema inteiro. Não há coluna de titular, nem coluna de organização, nem coluna de contato, porque esses dados são ocultados no registro e não são reconstruídos aqui. Datas de registro aparecem somente onde a zona de origem as publica; em muitos ccTLDs isso não acontece, e a coluna simplesmente não existe em vez de ser estimada.
Arquivos em massa vs. consultas WHOIS
| Aspecto | Consulta WHOIS ao registro .in | Pacotes de zona / enriquecidos em massa |
|---|---|---|
| Unidade de trabalho | Um domínio por consulta | Um arquivo por zona |
| Responde "quais domínios existem?" | Não | Sim |
| Datas de registro e expiração | Sim, autoritativas | Somente onde a zona de origem as publica |
| Códigos de status do domínio | Sim | Não |
| Servidores de nomes | Sim | Sim |
| MX, IP resolvido, CMS detectado | Não | Sim, nos conjuntos enriquecidos |
| Dados de contato do titular | Ocultos na maioria dos domínios | Não incluídos |
| Limite de taxa | Rígido, imposto pelo registro | Nenhum após o download |
| Formato de saída | Texto livre, dependente do registrar | O formato do download varia conforme o pacote e é informado na página do produto. |
| Custo | Grátis por consulta, inviável em massa | A partir de $3.50 por pacote |
Os dois se complementam. O WHOIS segue sendo a autoridade sobre o status de um domínio que você já identificou. Os arquivos em massa são como você identifica a população em primeiro lugar.
Trabalhando com dados de domínios .in na prática
Não há interface de busca nem filtragem no servidor. Você escolhe um pacote, compra, baixa o ZIP e faz a análise na sua própria máquina.
Passo 1 — Encontre o pacote. /zones/ lista os 716 arquivos de zona por TLD e suas versões enriquecidas, com a contagem de linhas exibida antes da compra para você saber o tamanho. /datasets/ reúne as 27 coleções curadas entre zonas, sendo a maior a de todos os domínios registrados, com 272.614.863 linhas. /packages/ é o catálogo completo, incluindo as 79 listas de sites por tecnologia.
Passo 2 — Compre e baixe. Os pacotes começam em $3.50 e o download é imediato; o arquivo é exportado na hora da compra, e não servido a partir de uma build antiga. Para uso recorrente, o Pro custa $29/mês (50 pacotes, 10 datasets, 30.000 chamadas de API) e o Enterprise, $99/mês (200 pacotes, 50 datasets, 300.000 chamadas de API). Veja /pricing/.
Passo 3 — Descompacte e inspecione.
unzip in-enriched.zip
head -3 in-enriched.csv
wc -l in-enriched.csv
Passo 4 — Recortes rápidos com ferramentas de linha de comando.
# second-level space breakdown
grep -oE '\.(co|net|org|firm|gen|ind)\.in$' in-enriched.csv | sort | uniq -c | sort -rn
# rows where the detected CMS is WordPress
awk -F',' '$5 == "WordPress"' in-enriched.csv > in-wordpress.csv
# top name servers
cut -d',' -f2 in-enriched.csv | sort | uniq -c | sort -rn | head -20
Passo 5 — Trabalho analítico em um motor colunar. O DuckDB lê o CSV diretamente, sem etapa de importação:
-- mail provider distribution
SELECT
CASE
WHEN mx ILIKE '%google%' THEN 'Google'
WHEN mx ILIKE '%outlook%' THEN 'Microsoft'
WHEN mx ILIKE '%zoho%' THEN 'Zoho'
WHEN mx IS NULL OR mx = '' THEN 'none'
ELSE 'other'
END AS provider,
count(*) AS domains
FROM read_csv_auto('in-enriched.csv')
GROUP BY provider ORDER BY domains DESC;
-- new domains between two snapshots
SELECT n.domain
FROM read_csv_auto('in-2026-07.csv') n
LEFT JOIN read_csv_auto('in-2026-04.csv') o USING (domain)
WHERE o.domain IS NULL;
Passo 6 — Automatize o acesso ao catálogo pela API. A API expõe o catálogo de pacotes, não uma consulta por domínio. A autenticação é feita com bearer token.
# list zone-file packages
curl -H "Authorization: Bearer YOUR_API_KEY" \
"https://webtrackly.com/api/v1/packages/?type=zone"
# technology packages matching a keyword
curl -H "Authorization: Bearer YOUR_API_KEY" \
"https://webtrackly.com/api/v1/packages/?type=technology&q=wordpress"
# details for a single package
curl -H "Authorization: Bearer YOUR_API_KEY" \
"https://webtrackly.com/api/v1/packages/in-zone/"
A referência dos endpoints está em /api/. Uma automação típica lista os pacotes que você acompanha, verifica se há uma build mais recente, baixa o arquivo e o carrega no data warehouse ao lado do snapshot anterior.
Erros comuns ao trabalhar com dados WHOIS do .in
-
Tratar o WHOIS como fonte em massa.
- O que dá errado: limites de taxa e CAPTCHAs travam o job depois de alguns milhares de consultas, e você fica com uma cobertura parcial que não sustenta nenhuma afirmação percentual.
- A correção: tire a população de um arquivo de zona e reserve as consultas para o pequeno subconjunto em que o status autoritativo por domínio realmente importa.
-
Esperar dados de contato do titular.
- O que dá errado: constrói-se um pipeline em torno de uma coluna de contato que é ocultada na origem e nunca chega.
- A correção: projete para o que o registro de fato contém — datas, registrar, status, servidores de nomes — e trate a obtenção de contatos como um problema separado, com sua própria base legal sob a DPDP Act e o GDPR.
-
Ignorar a estrutura de segundo nível do .in.
- O que dá errado: contar apenas
*.ine deixar de fora.co.in,.net.in,.org.ine os demais subdimensiona o namespace, às vezes de forma substancial. - A correção: enumere explicitamente os espaços de segundo nível e reporte-os separadamente; eles atraem perfis diferentes de titular e se comportam de forma diferente ao longo do tempo.
- O que dá errado: contar apenas
-
Esquecer os TLDs internacionalizados.
- O que dá errado: uma análise que diz cobrir "o espaço de domínios da Índia" exclui silenciosamente os ccTLDs em escrita nativa administrados pela NIXI.
- A correção: declare seu escopo com precisão. Se você mediu apenas a árvore ASCII do .in, diga isso em vez de generalizar para o país inteiro.
-
Ler a data de criação como data de fundação da empresa.
- O que dá errado: um domínio registrado em 2019 é apresentado como um negócio fundado em 2019, quando pode ser um rebranding, um registro defensivo ou uma transferência em que a data foi reiniciada.
- A correção: trate a data de criação como a idade do registro e busque corroboração antes de afirmar qualquer coisa sobre a organização.
-
Trabalhar com um único snapshot.
- O que dá errado: você consegue descrever o estado atual, mas não a tendência — que costuma ser justamente a pergunta feita.
- A correção: arquive e date cada download. Crescimento, churn e migração de provedor exigem duas observações.
-
Exagerar na detecção de CMS.
- O que dá errado: um número de market share com ar de precisão desmorona quando alguém com outro método de detecção discorda.
- A correção: um campo de CMS vazio significa "não detectado", não "sem CMS". Reporte a taxa de detecção junto de cada fatia e descreva os números como instalações detectadas.
FAQ: WHOIS do registro .in
P: O que é o WHOIS do registro .in?
R: É a base pública de registros do namespace .in, operada pela NIXI. Uma consulta devolve o registro de um único domínio: datas de criação, atualização e expiração, o registrar patrocinador, os códigos de status do domínio e os servidores de nomes delegados. Os campos de contato estão ocultos na maioria dos domínios.
P: Por que as informações do titular estão escondidas?
R: A prática de divulgação dos registries mudou globalmente após o GDPR, e os dados pessoais nos registros passaram a ser suprimidos por padrão das respostas públicas. A Digital Personal Data Protection Act, 2023 da Índia aponta no mesmo sentido. A divulgação em geral exige uma base legal documentada apresentada ao registrar.
P: Posso consultar o WHOIS do .in em massa?
R: Na prática, não. O acesso pela porta 43 tem limite de taxa por IP e a interface web é protegida por CAPTCHA. O protocolo foi feito para consultas pontuais, um domínio por vez.
P: A WebTrackly faz consultas WHOIS por mim?
R: Não. A WebTrackly distribui arquivos em massa já preparados. O formato do download varia conforme o pacote e é informado na página do produto. Não há serviço de consulta nem endpoint de consulta por domínio.
P: O que vem dentro de um pacote?
R: Os pacotes de arquivo de zona contêm a lista de domínios de um TLD. Os pacotes de zona enriquecidos acrescentam servidores de nomes, registros MX, IPs resolvidos e CMS detectado, quando determináveis. Os pacotes de tecnologia listam sites onde um determinado CMS ou tecnologia foi detectado. Os datasets curados são compilações entre zonas.
P: Há endereços de e-mail ou telefones incluídos?
R: Não. Os arquivos contêm apenas atributos de domínio e de infraestrutura, sem nenhum dado de contato pessoal ou corporativo.
P: Qual é o tamanho do catálogo?
R: 1.538 pacotes: 716 arquivos de zona, 716 conjuntos de zona enriquecidos, 79 listas de sites por tecnologia e 27 datasets curados, cobrindo 285.582.781 domínios nos pacotes de zona. O dataset de todos os domínios registrados tem 272.614.863 linhas.
P: Quão atualizados são os dados?
R: Cada pacote é exportado no momento da compra, então você recebe a build atual. Para acompanhar mudanças, compre o mesmo pacote novamente mais tarde e faça o diff dos dois arquivos.
P: O que a API faz?
R: Ela expõe o catálogo. GET /api/v1/packages/?type=zone lista os pacotes de zona, ?type=technology&q=wordpress filtra os pacotes de tecnologia e /api/v1/packages/{slug}/ devolve os detalhes de um pacote. A autenticação é por bearer token. Ela não aceita um nome de domínio para devolver fatos sobre ele.
P: Quanto custa?
R: Pacotes individuais a partir de $3.50, em compra única. O Pro custa $29/mês (50 pacotes, 10 datasets, 30.000 chamadas de API); o Enterprise, $99/mês (200 pacotes, 50 datasets, 300.000 chamadas de API). Veja /pricing/.
Conclusão
O WHOIS do registro .in é uma fonte confiável para os fatos de registro de um domínio que você já tem em mãos: quando foi criado, quem o patrocina, que status carrega, para onde delega o DNS. Ele não é uma ferramenta de descoberta, não é uma base de contatos, e nenhuma quantidade de scripts vai fazê-lo se comportar como uma coisa ou outra.
Perguntas de nível populacional sobre o espaço de domínios da Índia — quantos domínios, em quais plataformas, atrás de quais provedores de DNS e de e-mail, em crescimento ou em retração — se respondem com arquivos de zona que você baixa e analisa localmente. O esquema é deliberadamente enxuto: domínio, servidores de nomes, MX, IP resolvido, CMS detectado e datas de registro apenas onde a origem as publica. Conhecer esse limite de antemão é o que impede um projeto de fracassar na última etapa.
Explore o catálogo de arquivos de zona →
Recursos relacionados
- Catálogo de pacotes — 1.538 bases de domínios para download
- Arquivos de zona por TLD — .com, .net, .de e mais de 700
- Datasets curados — todos os domínios registrados, servidores MX, e-commerce
- Documentação da API — acesso ao catálogo com bearer token
- Preços — compras únicas a partir de $3.50