Domain Intelligence

Зональные файлы: как получить и отфильтровать доменные данные

blureshot Июль 12, 2026 8 мин. чтения 85 просмотров
A detailed diagram illustrating the structure and flow of a TLD zone file.
A detailed diagram illustrating the structure and flow of a TLD zone file.

Зональные файлы — фундамент доменной аналитики: это снимок всех активных доменов в конкретном домене верхнего уровня вместе с их DNS-записями. Умение получать, разбирать и фильтровать их отличает доменный датасет, с которым можно работать, от большого текстового файла, с которым работать нельзя. В этом руководстве разбираем, откуда берутся зональные данные, почему национальные зоны получить намного сложнее, чем общие, и как свести сырой фид к чему-то пригодному для работы.

Готовы работать с реальными зональными данными? WebTrackly предоставляет готовые к скачиванию базы доменов: зональные файлы TLD, обогащённые зональные данные с полями NS, MX, IP и CMS, списки сайтов по технологиям и подготовленные датасеты — разовыми выгрузками в CSV, без подписки.

Смотреть базы доменов — мгновенное скачивание CSV

Кратко

  • Сырые фиды новых зарегистрированных доменов (NRD) шумные: значительная доля — припаркованные страницы и PPC-спам, поэтому фильтрация обязательна до начала работы.
  • Получить зональные файлы ccTLD заметно сложнее, чем gTLD: реестры вроде .de и .fr не публикуют зону вообще, и остаётся полагаться на агрегированные данные.
  • Ценность списка доменов для холодных рассылок быстро падает без проверки MX — перепроверяйте доставляемость на той же неделе, когда отправляете.
  • WebTrackly охватывает 716 зональных файлов TLD и 716 обогащённых зональных наборов, 279,944,703 домена по всем зонам, в формате CSV внутри ZIP.
  • Для лидогенерации, чувствительной ко времени, свежая выгрузка выигрывает у куда более объёмного, но устаревшего дампа с маркетплейса.

Что такое зональный файл

Зональный файл — это текстовый файл со списком активных доменных имён в конкретном TLD и их DNS-записями. Например, зональный файл .com перечисляет каждый зарегистрированный домен .com и его записи серверов имён (NS) — 163,422,083 домена в текущей выгрузке этой зоны у WebTrackly. Доступ к зональным файлам gTLD регулируется соглашениями ICANN и обычно требует подачи заявки, одобрения и обязательств о том, как данные будут использоваться; общие рамки описаны в документации реестровой программы ICANN.

Ценность зонального файла не столько в объёме, сколько в структуре. Каждая запись даёт доменное имя, его серверы имён, а иногда и glue-записи — IP-адреса серверов имён, находящихся внутри самого TLD. Этого достаточно, чтобы отслеживать хостинговые связи, определять DNS-провайдеров и группировать домены по общей инфраструктуре, а на этом строится почти любая методика фильтрации, которой стоит пользоваться.

Получение зональных файлов: gTLD против ccTLD

Основная сложность сосредоточена именно в получении данных, и разрыв между общими и национальными доменами верхнего уровня здесь велик.

Зональные файлы gTLD

Для общих TLD вроде .com, .org или .info процесс стандартизирован, но бюрократичен. Реестры — Verisign для .com и .net — ведут программы доступа к зональным файлам с подачей заявки, соглашениями об использовании, а в отдельных случаях и с оплатой. Подробности опубликованы на странице доступа к зональным файлам Verisign. Одобрение — только начало: файлы обновляются ежедневно, приходят в сжатом виде, и их нужно распаковывать, разбирать и индексировать по расписанию. Это постоянные инфраструктурные обязательства, а не разовое скачивание.

Зональные файлы ccTLD: задача посложнее

Зональные файлы ccTLD получить намного сложнее, чем зональные файлы gTLD. Многие национальные реестры вообще не публикуют зональный файл. Немецкий .de и французский .fr — самые заметные примеры: оба ссылаются на приватность регистрантов и национальную политику. Поскольку реестры ccTLD не связаны политиками ICANN так, как реестры gTLD, апеллировать не к чему — централизованной программы доступа нет, каждый реестр устанавливает свои условия, и у заметной их части ответ — просто «нет».

Остаются агрегированные данные — единственный практичный путь к покрытию таких зон. Это же означает, что доступность по конкретным TLD неравномерна у любого поставщика на этом рынке, включая нас. Прежде чем выстраивать процесс вокруг конкретной национальной зоны, проверьте, есть ли она в каталоге: сейчас WebTrackly публикует 716 зональных файлов TLD и парные обогащённые наборы в разделе доменных данных. Если вас интересуют именно новые зарегистрированные домены, посмотрите наше руководство по работе с новыми зарегистрированными доменами.

Не позволяйте закрытым реестрам тормозить ваше исследование. WebTrackly предоставляет готовые к скачиванию базы доменов: зональные файлы TLD, обогащённые зональные данные, списки сайтов по технологиям и подготовленные датасеты — CSV внутри ZIP, файл формируется в момент покупки, от $3.50.

Смотреть базы доменов — мгновенное скачивание CSV

Фильтрация шума: от сырого зонального файла к рабочему списку

Сырой зональный файл — или построенный на его основе ежедневный фид новых зарегистрированных доменов — это поток из брандспойта. Сложность не в том, чтобы получить данные, а в том, чтобы получить полезные данные: значительная доля любого NRD-фида приходится на припаркованные страницы и PPC-спам, и без жёсткой фильтрации построенная на них рассылка обречена по определению.

Методика фильтрации

  • Распознавание паттернов серверов имён. Самый результативный фильтр. NS-записи, указывающие на парковочных провайдеров, говорят о домене без работающего сайта, и такие домены собираются в кластеры — один паттерн убирает сразу многие. Работает офлайн по CSV, где поля NS уже есть, и не стоит ничего, кроме обработки.
  • Фильтрация по регистратору. Массовые дешёвые регистрации концентрируются у горстки регистраторов и сильно коррелируют с парковочными кластерами выше, поэтому два фильтра усиливают друг друга, а не дублируют.
  • Анализ WHOIS. Анонимные регистрации, шаблонные контактные адреса и сервисы приватности — слабые сигналы по отдельности, но полезны в связке со структурными фильтрами.
  • Анализ технологий и контента. Для короткого списка проверка того, на какой платформе работает сайт, добавляет сильное измерение квалификации. WebTrackly публикует 79 списков сайтов по технологиям с определением CMS и платформ — WordPress на 21,639,326 доменах, Joomla на 607,765 и другие.

Порядок важен. Сначала прогоните бесплатные структурные фильтры по всей зоне, а сетевые запросы тратьте только на то, что уцелело. Обратный порядок — самый распространённый способ превратить дешёвый анализ в дорогой.

Почему зональные данные сложнее, чем кажется

Двум вещам стабильно удивляются те, кто приходит сюда из общей работы с данными.

Первая: для работы с новыми зарегистрированными доменами свежесть — не приятное дополнение, а весь смысл. NRD интересны именно тем, что за ними стоят бизнесы на этапе запуска: они ещё выбирают подрядчиков и принимают решения. Когда это окно закрылось, список превращается просто в список доменов, и его размер этого не компенсирует. Поэтому WebTrackly формирует каждый файл в момент покупки, а не раздаёт заранее собранный архив.

Вторая: интересные объёмы не ограничиваются старыми TLD. Новые gTLD вроде .xyz, .online и .site содержат больше мусора, чем .com, но абсолютный объём регистраций там достаточно высок, чтобы хорошо отфильтрованная выборка всё равно дала осмысленный список. Ограничить покрытие доменами .com и .net — это решение проигнорировать значительную часть текущего ландшафта регистраций, а не нейтральный вариант по умолчанию.

Практические выводы

  1. Ставьте свежесть в приоритет для NRD-кампаний. Если вы нацелены на только что запустившиеся бизнесы, возраст данных — та переменная, которая определяет результат. Работайте со свежей выгрузкой.
  2. Проверяйте MX-записи перед холодной рассылкой. Список доменов хорош ровно настолько, насколько проверены его MX-записи, а проверка устаревает. Сделайте офлайн-проход по полю MX в обогащённых зональных данных, а затем прогоните живые проверки сервисом вроде Hunter.io или ZeroBounce непосредственно перед отправкой. WebTrackly продаёт только данные уровня домена — без контактных записей, e-mail адресов и телефонов.
  3. Не списывайте ccTLD со счетов, но сначала проверьте покрытие. Возможности таргетинга в национальном пространстве реальны, но и проблема доступа к данным реальна тоже. Убедитесь, что нужная зона доступна, прежде чем выстраивать процесс вокруг неё.
  4. Сначала структурные фильтры, затем выборочные. Фильтры по серверам имён и регистраторам — по всему файлу, сетевые запросы — только по уцелевшим.
  5. Сегментируйте по технологиям. Знание того, что домен работает на WordPress, Shopify или Magento, делает обращение кратно точнее. Списки сайтов по технологиям существуют ровно для того, чтобы вам не пришлось строить определение самостоятельно.

Частые вопросы

Чем зональный файл отличается от обогащённых зональных данных?

Зональный файл перечисляет домены в TLD вместе с их записями серверов имён — техническая карта того, что существует. Обогащённые зональные данные добавляют сверху атрибуты по каждому домену: поля NS, MX, IP и CMS, — именно это делает фильтрацию возможной без собственной инфраструктуры краулинга и резолвинга. WebTrackly публикует по 716 пакетов каждого типа — в разделах зоны и доменные данные.

Почему зональные файлы ccTLD получить сложнее, чем зональные файлы gTLD?

Из-за национального регулирования и автономии реестров. Многие национальные реестры, особенно в Европе, ставят во главу угла приватность регистрантов и не публикуют полный зональный файл, часто ссылаясь на законодательство о защите данных. Крупные реестры gTLD работают по соглашениям с ICANN, которые предусматривают доступ к зональным файлам на определённых условиях. Для национального пространства аналогичного центрального механизма нет, поэтому там, где прямой доступ недоступен, практичной альтернативой становятся агрегированные данные.

Насколько актуальны данные в момент скачивания?

Каждый файл выгружается в момент покупки, а не отдаётся из заранее собранного архива, поэтому отражает состояние зоны на этот момент. Вы получаете CSV внутри ZIP, доступный сразу после оплаты.

Сколько это стоит?

Отдельные пакеты начинаются от $3.50 и покупаются разово, без подписки. Для регулярной работы есть два плана: Pro за $29 в месяц — 50 пакетов и 10 датасетов с 30K API-вызовов, и Enterprise за $99 в месяц — 200 пакетов и 50 датасетов с 300K API-вызовов. Межзональные коллекции, включая полный датасет всех доменов на 272,614,863 строки, перечислены в разделе датасеты. Смотрите также наше парное руководство о DNS-записях в зональных данных.

Готовы работать с актуальными доменными данными? WebTrackly предлагает 1,538 пакетов — 716 зональных файлов TLD, 716 обогащённых зональных наборов, 79 списков сайтов по технологиям и 27 подготовленных датасетов — с мгновенным скачиванием в CSV.

Смотреть базы доменов — мгновенное скачивание CSV

Поделиться записью

Twitter Facebook LinkedIn

Похожие записи

Комментарии (0)

Оставить комментарий

Комментариев пока нет. Будьте первым!

support_agent
WebTrackly Support
Usually replies within minutes
Привет!
Напишите нам, и мы ответим как можно скорее.