India gestiona uno de los espacios de dominios nacionales más grandes del mundo, y el registro que hay detrás publica un servicio WHOIS que cualquiera puede consultar. Lo que ese servicio devuelve —y lo que ya no devuelve— ha cambiado bastante en los últimos años, y la mayoría de las guías lo siguen describiendo tal y como funcionaba hace una década. Este artículo explica cómo funciona realmente hoy el WHOIS del registro .in, qué campos sobreviven a la ocultación de datos, por qué la recopilación masiva por WHOIS es inviable y cómo montar en su lugar un conjunto de datos utilizable de dominios indios a partir de archivos de zona.
RESUMEN / IDEAS CLAVE
- NIXI opera el espacio .in: el National Internet Exchange of India gestiona .in y sus espacios de segundo nivel —.co.in, .net.in, .org.in, .firm.in, .gen.in, .ind.in— además de un conjunto de TLD internacionalizados para las escrituras de India.
- WHOIS es un protocolo de dominio en dominio: una consulta devuelve un registro. Está limitado por tasa, a veces protegido con CAPTCHA, y devuelve texto libre cuyo formato varía según el registrador.
- Los campos del titular están en su mayoría ocultos: nombre, correo electrónico, teléfono y dirección postal se omiten en la mayoría de los dominios. La Digital Personal Data Protection Act, 2023 de India refuerza esa tendencia en lugar de revertirla.
- Lo que sí se obtiene de forma fiable: fechas de creación, actualización y caducidad, registrador, códigos de estado del dominio y servidores de nombres.
- Los archivos de zona responden a lo que el WHOIS no puede: qué dominios existen, qué servidores de nombres y de correo utilizan, dónde resuelven y qué CMS es detectable.
- WebTrackly distribuye esos archivos: 1.538 paquetes —716 archivos de zona por TLD, 716 conjuntos de zona enriquecidos (NS, MX, IP, CMS), 79 listados de sitios por tecnología y 27 conjuntos de datos curados— que cubren 285.582.781 dominios en total.
- Sin datos de contacto: los paquetes contienen únicamente atributos de dominio e infraestructura. Ni direcciones de correo, ni números de teléfono, ni identidades de titulares.
ÍNDICE DE CONTENIDOS
- Cómo funciona el WHOIS del registro .in y qué devuelve hoy
- Cinco preguntas de investigación que responden los datos de dominios .in
- Qué contiene un archivo de datos de zona
- Archivos masivos frente a consultas WHOIS
- Trabajar con datos de dominios .in en la práctica
- Errores habituales al trabajar con datos WHOIS de .in
- Preguntas frecuentes: WHOIS del registro .in
- Conclusión
- Recursos relacionados
Cómo funciona el WHOIS del registro .in y qué devuelve hoy
El espacio .in lo administra el National Internet Exchange of India (NIXI) a través de su operación de registro. Abarca el segundo nivel abierto (example.in) y un conjunto de espacios de segundo nivel estructurados con finalidades previstas: .co.in para entidades comerciales, .net.in para proveedores de red, .org.in para organizaciones, y .firm.in, .gen.in, .ind.in para categorías más específicas. NIXI administra además ccTLD internacionalizados para las escrituras de India, de modo que una imagen completa del espacio de dominios del país no se limita a la cadena ASCII «.in».
El registro publica un servicio WHOIS que sigue el patrón thin/thick habitual en los ccTLD: el registro del registry conserva los datos técnicos autorizados, mientras que el registrador guarda los datos de contacto que se hayan recogido. Al consultarlo, puedes contar con que un pequeño conjunto de campos esté presente y sea exacto: la fecha de creación, la fecha de última actualización, la fecha de caducidad, el registrador patrocinador, los códigos de estado del dominio (clientTransferProhibited, pendingDelete, etc.) y los servidores de nombres delegados.
Con lo que ya no puedes contar es con el bloque de contacto. Desde que el RGPD reconfiguró las prácticas de divulgación de los registros a escala global, el nombre del titular, la organización, el correo electrónico, el teléfono y la dirección postal se ocultan en las respuestas públicas para la gran mayoría de dominios, sustituidos por un marcador de posición o por una dirección de reenvío gestionada por el registrador. La propia Digital Personal Data Protection Act, 2023 de India apunta en la misma dirección: los datos personales de un titular son datos personales con independencia de que figuren en un registro de dominio. Cualquier flujo de trabajo que dé por hecho que el WHOIS público proporcionará una persona a la que contactar se apoya en una premisa que ya no se sostiene.
La segunda restricción es mecánica. WHOIS responde un dominio por consulta. Para perfilar 10.000 dominios haces 10.000 consultas, y los registros limitan precisamente ese comportamiento: el acceso por el puerto 43 está limitado por tasa según la IP, y la interfaz web añade un CAPTCHA. El formato de respuesta varía según el registrador, así que un parser que funciona con un registro falla con el siguiente. Nada en el protocolo se diseñó para una recopilación a escala poblacional, y ninguna ingeniería alrededor cambia eso.
De ahí se deriva un reparto de tareas muy claro. Usa WHOIS cuando tengas un dominio concreto y necesites su estado de registro autorizado: para eso es bueno. Cuando la pregunta es sobre la población —cuántos dominios existen, qué ejecutan, dónde resuelven, cómo cambia todo eso con el tiempo—, la respuesta llega desde los datos de zona, distribuidos como archivos en lugar de consultarse registro a registro.
¿Necesitas el listado de dominios y no una consulta suelta?
Explora el catálogo de archivos de zona: 716 TLD con el número de filas publicado antes de la compra.
Ver zonas → | Ver precios →
Cinco preguntas de investigación que responden los datos de dominios .in
Los datos de zona son datos poblacionales. Permiten contar, agrupar y comparar a lo largo del tiempo. No identifican a personas, y ninguno de los flujos de trabajo siguientes depende de hacerlo.
1. Medir la adopción de CMS y plataformas en un espacio nacional
Las cifras publicadas sobre qué plataformas dominan en un país suelen extrapolarse a partir de una muestra de los N sitios más populares, lo que sesga con fuerza hacia las grandes organizaciones. Un archivo de zona con una columna de detección de CMS permite contar directamente contra un denominador conocido. En todo el catálogo de WebTrackly, WordPress se detecta en 21.639.326 dominios y Joomla en 567.680; el mismo cálculo restringido a una sola zona ofrece la distribución de esa zona.
Publica siempre el denominador y la tasa de detección. «X dominios de los Y cubiertos, con un Z% de filas que llevan un valor de CMS» es una afirmación que resiste el escrutinio. Un porcentaje a secas, no.
2. Cartografiar proveedores de DNS y de hosting
Los registros de servidores de nombres son la señal de proveedor más fiable del conjunto de datos. Agrupar la columna NS por sufijo muestra qué operadores de DNS —plataformas globales, hosts regionales, registradores individuales— sostienen la zona, y la distribución suele estar mucho más concentrada de lo esperado. Las IP resueltas aportan una segunda perspectiva, aunque hay que interpretarla con cuidado: un sitio detrás de una CDN publica la dirección de la CDN, de modo que las cuotas derivadas de la IP miden el borde y no el origen.
3. Analizar la infraestructura de correo
Los registros MX de los conjuntos enriquecidos muestran hacia dónde enruta el correo un dominio. Si clasificas los nombres de host MX por patrón de proveedor, obtienes el reparto entre plataformas de correo gestionado, proveedores regionales y servidores autogestionados en toda la zona. Comparar dos instantáneas tomadas con meses de diferencia revela la migración entre ellos, que es la pregunta real detrás de casi todos los debates sobre «quién gana en el correo electrónico». Un registro MX es un destino de enrutamiento, no un buzón: en estos archivos no hay direcciones.
4. Seguir el crecimiento y la rotación
El volumen de registros es un indicador muy citado de la actividad digital, y es una de las pocas cosas que puedes medir por tu cuenta en lugar de tomarla de una nota de prensa. Compra el mismo paquete de zona en dos momentos distintos, compara las columnas de dominio y obtendrás las altas y las bajas del intervalo, sin depender de las estadísticas que publique nadie. Conserva y fecha cada archivo que descargues: una instantánea que descartaste es una comparación que ya no podrás hacer.
5. Investigación de seguridad y superficie de ataque
El reconocimiento que parte de consultas WHOIS se detiene casi de inmediato en los límites de tasa. Partir de un archivo de zona elimina ese techo: filtra en local el subconjunto que te interesa —un CMS, un servidor de nombres, un rango de IP— y pasa esa lista a tus propias herramientas de verificación. El archivo aporta la población; el análisis sigue siendo cosa tuya. Las pruebas activas deben mantenerse dentro del alcance para el que estás autorizado, y una lista de dominios descargable no es una autorización.
Qué contiene un archivo de datos de zona
El formato de descarga depende del paquete y se indica en la página del producto. Los paquetes de archivo de zona contienen el listado de dominios. Los paquetes de zona enriquecidos añaden servidores de nombres, registros MX, IP resueltas y CMS detectado, con valores allí donde se han podido determinar y vacíos en caso contrario.
| domain | ns | mx | ip | cms |
|---|---|---|---|---|
| exampleindia.co.in | ns1.hostinger.in | mx1.hostinger.in | 156.67.x.x | WordPress |
| techsolutions.in | ns-1234.awsdns-56.org | aspmx.l.google.com | 13.234.x.x | |
| mydelhi-store.in | ns1.cloudflare.com | 104.18.x.x | ||
| bengaluru-it.in | ns1.bluehost.in | mail.bengaluru-it.in | 162.241.x.x | Joomla |
| globalexports.in | ns1.vultr.com | mx.zoho.in | 139.84.x.x |
Ese es todo el esquema. No hay columna de titular, ni de organización, ni de contacto, porque esos datos están ocultos en el registro y aquí no se reconstruyen. Las fechas de registro aparecen solo cuando la zona de origen las publica; en muchos ccTLD no lo hacen, y la columna simplemente no está en lugar de estimarse.
Archivos masivos frente a consultas WHOIS
| Aspecto | Consulta WHOIS al registro .in | Paquetes masivos de zona / enriquecidos |
|---|---|---|
| Unidad de trabajo | Un dominio por consulta | Un archivo por zona |
| Responde a «¿qué dominios existen?» | No | Sí |
| Fechas de registro y caducidad | Sí, autorizadas | Solo cuando la zona de origen las publica |
| Códigos de estado del dominio | Sí | No |
| Servidores de nombres | Sí | Sí |
| MX, IP resuelta, CMS detectado | No | Sí, en los conjuntos enriquecidos |
| Datos de contacto del titular | Ocultos en la mayoría de dominios | No se incluyen |
| Límites de tasa | Estrictos, impuestos por el registro | Ninguno tras la descarga |
| Formato de salida | Texto libre, dependiente del registrador | El formato de descarga depende del paquete y se indica en la página del producto. |
| Coste | Gratis por consulta, inviable a gran escala | Desde $3.50 por paquete |
Ambos enfoques se complementan. WHOIS sigue siendo la autoridad sobre el estado de un dominio que ya has identificado. Los archivos masivos son la vía para identificar la población en primer lugar.
Trabajar con datos de dominios .in en la práctica
No hay interfaz de búsqueda ni filtrado en el servidor. Eliges un paquete, lo compras, descargas el ZIP y haces el análisis en tu propia máquina.
Paso 1 — Localiza el paquete. /zones/ lista los 716 archivos de zona por TLD y sus equivalentes enriquecidos, con el número de filas visible antes de la compra para que sepas el tamaño. /datasets/ reúne las 27 colecciones curadas entre zonas; la mayor es la de todos los dominios registrados, con 272.614.863 filas. /packages/ es el catálogo completo, incluidos los 79 listados de sitios por tecnología.
Paso 2 — Compra y descarga. Los paquetes parten de $3.50 y se descargan al instante; el archivo se exporta en el momento de la compra en vez de servirse desde una compilación antigua. Para un uso recurrente, Pro cuesta $29/mes (50 paquetes, 10 conjuntos de datos, 30.000 llamadas a la API) y Enterprise, $99/mes (200 paquetes, 50 conjuntos de datos, 300.000 llamadas a la API). Consulta /pricing/.
Paso 3 — Descomprime e inspecciona.
unzip in-enriched.zip
head -3 in-enriched.csv
wc -l in-enriched.csv
Paso 4 — Cortes rápidos con herramientas de línea de comandos.
# second-level space breakdown
grep -oE '\.(co|net|org|firm|gen|ind)\.in$' in-enriched.csv | sort | uniq -c | sort -rn
# rows where the detected CMS is WordPress
awk -F',' '$5 == "WordPress"' in-enriched.csv > in-wordpress.csv
# top name servers
cut -d',' -f2 in-enriched.csv | sort | uniq -c | sort -rn | head -20
Paso 5 — Trabajo analítico en un motor columnar. DuckDB lee el CSV directamente, sin paso de importación:
-- mail provider distribution
SELECT
CASE
WHEN mx ILIKE '%google%' THEN 'Google'
WHEN mx ILIKE '%outlook%' THEN 'Microsoft'
WHEN mx ILIKE '%zoho%' THEN 'Zoho'
WHEN mx IS NULL OR mx = '' THEN 'none'
ELSE 'other'
END AS provider,
count(*) AS domains
FROM read_csv_auto('in-enriched.csv')
GROUP BY provider ORDER BY domains DESC;
-- new domains between two snapshots
SELECT n.domain
FROM read_csv_auto('in-2026-07.csv') n
LEFT JOIN read_csv_auto('in-2026-04.csv') o USING (domain)
WHERE o.domain IS NULL;
Paso 6 — Automatiza el acceso al catálogo con la API. La API expone el catálogo de paquetes, no una consulta de dominios. La autenticación es mediante bearer token.
# list zone-file packages
curl -H "Authorization: Bearer YOUR_API_KEY" \
"https://webtrackly.com/api/v1/packages/?type=zone"
# technology packages matching a keyword
curl -H "Authorization: Bearer YOUR_API_KEY" \
"https://webtrackly.com/api/v1/packages/?type=technology&q=wordpress"
# details for a single package
curl -H "Authorization: Bearer YOUR_API_KEY" \
"https://webtrackly.com/api/v1/packages/in-zone/"
La referencia de endpoints está en /api/. Una automatización típica lista los paquetes que sigues, comprueba si hay una compilación más reciente, la descarga y la carga en el almacén junto a la instantánea anterior.
Errores habituales al trabajar con datos WHOIS de .in
-
Tratar el WHOIS como una fuente masiva.
- Qué falla: los límites de tasa y los CAPTCHA bloquean el proceso tras unos pocos miles de consultas y te quedas con una cobertura parcial que no sostiene ninguna afirmación porcentual.
- La solución: toma la población de un archivo de zona y reserva las consultas para el pequeño subconjunto en el que el estado autorizado de cada dominio importa de verdad.
-
Esperar datos de contacto del titular.
- Qué falla: se construye un pipeline en torno a una columna de contacto que está oculta en el origen y que nunca llega.
- La solución: diseña para lo que el registro contiene realmente —fechas, registrador, estado, servidores de nombres— y trata la obtención de contactos como un problema aparte, con su propia base legal bajo la DPDP Act y el RGPD.
-
Ignorar la estructura de segundo nivel de .in.
- Qué falla: contar solo
*.iny dejar fuera.co.in,.net.in,.org.iny el resto infravalora el espacio de nombres, a veces de forma notable. - La solución: enumera explícitamente los espacios de segundo nivel y repórtalos por separado; atraen a tipos de titulares distintos y evolucionan de forma diferente con el tiempo.
- Qué falla: contar solo
-
Olvidar los TLD internacionalizados.
- Qué falla: un análisis que dice cubrir «el espacio de dominios de India» excluye en silencio los ccTLD basados en escrituras que administra NIXI.
- La solución: define tu alcance con precisión. Si solo has medido el árbol ASCII .in, dilo en lugar de generalizar al país entero.
-
Leer una fecha de creación como la fecha de fundación de una empresa.
- Qué falla: un dominio registrado en 2019 se presenta como un negocio fundado en 2019, cuando puede tratarse de un cambio de marca, un registro defensivo o una transferencia en la que la fecha se reinició.
- La solución: interpreta la fecha de creación como la antigüedad del registro y corrobora la información antes de afirmar nada sobre la organización.
-
Trabajar con una única instantánea.
- Qué falla: puedes describir el estado actual, pero no la tendencia, que suele ser justo lo que se pregunta.
- La solución: archiva y fecha cada descarga. El crecimiento, la rotación y la migración entre proveedores requieren dos observaciones.
-
Exagerar la detección de CMS.
- Qué falla: una cifra de cuota de mercado con aire de precisión se derrumba en cuanto alguien con otro método de detección discrepa.
- La solución: un campo CMS vacío significa «no detectado», no «sin CMS». Publica la tasa de detección junto a cada cuota y describe las cifras como instalaciones detectadas.
Preguntas frecuentes: WHOIS del registro .in
P: ¿Qué es el WHOIS del registro .in?
R: la base de datos pública de registros del espacio .in, operada por NIXI. Una consulta devuelve el registro de un único dominio: fechas de creación, actualización y caducidad, el registrador patrocinador, los códigos de estado del dominio y los servidores de nombres delegados. Los campos de contacto están ocultos en la mayoría de dominios.
P: ¿Por qué está oculta la información del titular?
R: las prácticas de divulgación de los registros cambiaron a escala global tras el RGPD, y los datos personales de los registros de dominio se omiten hoy por defecto en las respuestas públicas. La Digital Personal Data Protection Act, 2023 de India apunta en la misma dirección. La divulgación suele exigir una base legal documentada presentada ante el registrador.
P: ¿Puedo consultar el WHOIS de .in de forma masiva?
R: en la práctica, no. El acceso por el puerto 43 está limitado por tasa según la IP y la interfaz web está protegida con CAPTCHA. El protocolo está pensado para consultas puntuales dominio a dominio.
P: ¿WebTrackly realiza consultas WHOIS por mí?
R: no. WebTrackly distribuye archivos masivos ya preparados. El formato de descarga depende del paquete y se indica en la página del producto. No hay servicio de consulta ni endpoint de consulta por dominio.
P: ¿Qué incluye un paquete?
R: los paquetes de archivo de zona contienen el listado de dominios de un TLD. Los paquetes de zona enriquecidos añaden servidores de nombres, registros MX, IP resueltas y CMS detectado allí donde se puede determinar. Los paquetes de tecnología listan los sitios en los que se ha detectado un CMS o una tecnología concreta. Los conjuntos de datos curados son recopilaciones que cruzan varias zonas.
P: ¿Se incluyen direcciones de correo o números de teléfono?
R: no. Los archivos contienen únicamente atributos de dominio e infraestructura, sin datos de contacto personales ni de empresa.
P: ¿Qué tamaño tiene el catálogo?
R: 1.538 paquetes: 716 archivos de zona, 716 conjuntos de zona enriquecidos, 79 listados de sitios por tecnología y 27 conjuntos de datos curados, que cubren 285.582.781 dominios en los paquetes de zona. El conjunto de datos de todos los dominios registrados contiene 272.614.863 filas.
P: ¿Cómo de actualizados están los datos?
R: cada paquete se exporta en el momento de la compra, así que obtienes la compilación actual. Para seguir los cambios, vuelve a comprar el mismo paquete más adelante y compara los dos archivos.
P: ¿Qué hace la API?
R: expone el catálogo. GET /api/v1/packages/?type=zone lista los paquetes de zona, ?type=technology&q=wordpress filtra los paquetes de tecnología y /api/v1/packages/{slug}/ devuelve los detalles de un paquete. Autenticación mediante bearer token. No acepta un nombre de dominio para devolver datos sobre él.
P: ¿Cuánto cuesta?
R: paquetes individuales desde $3.50 en compra única. Pro cuesta $29/mes (50 paquetes, 10 conjuntos de datos, 30.000 llamadas a la API); Enterprise, $99/mes (200 paquetes, 50 conjuntos de datos, 300.000 llamadas a la API). Consulta /pricing/.
Conclusión
El WHOIS del registro .in es una fuente fiable para los datos de registro de un dominio que ya tienes entre manos: cuándo se creó, quién lo patrocina, qué estado tiene, dónde delega el DNS. No es una herramienta de descubrimiento, no es una base de datos de contactos y ningún script conseguirá que se comporte como tal.
Las preguntas a nivel poblacional sobre el espacio de dominios de India —cuántos dominios hay, sobre qué plataformas, tras qué proveedores de DNS y de correo, en crecimiento o en retroceso— se responden con archivos de zona que descargas y analizas en local. El esquema es deliberadamente estrecho: dominio, servidores de nombres, MX, IP resuelta, CMS detectado y fechas de registro solo donde el origen las publica. Conocer ese límite de antemano es lo que evita que un proyecto fracase en el último paso.
Explora el catálogo de archivos de zona →
Recursos relacionados
- Catálogo de paquetes — 1.538 bases de datos de dominios descargables
- Archivos de zona por TLD — .com, .net, .de y más de 700 adicionales
- Conjuntos de datos curados — todos los dominios registrados, servidores MX, comercio electrónico
- Documentación de la API — acceso al catálogo con bearer token
- Precios — compras únicas desde $3.50