Domain Intelligence

Liste de domaines AWS : comment identifier les domaines hébergés sur AWS

blureshot juillet 09, 2026 7 min de lecture 547 vues
A detailed graphic showing connections between AWS services and various domain names.
A detailed graphic showing connections between AWS services and various domain names.

Pour la veille concurrentielle, la génération de leads ou la recherche en sécurité, une liste de domaines AWS précise a de la valeur : le choix d'hébergement est un indicateur fiable de la taille d'une entreprise, de sa maturité technique et de son budget. C'est aussi l'un des éléments les plus difficiles à déterminer à partir des seules données de domaines, car la plupart des sites utilisent AWS pour un service précis — S3, EC2, Route 53, CloudFront — plutôt que comme registrar ou comme fournisseur unique.

Vous cherchez des données de domaines fraîches ? WebTrackly propose des téléchargements CSV instantanés de fichiers de zone TLD, de données de zone enrichies avec les champs NS, MX, IP et CMS, de listes de sites par technologie et de jeux de données sélectionnés — sans abonnement.

Voir les packages de données

Le défi : identifier les domaines hébergés sur AWS à partir de données brutes

Il n'existe aucun indicateur « AWS » dans un enregistrement WHOIS. L'identification doit être déduite, et trois signaux sont exploitables en pratique, par ordre croissant de coût.

Le moins coûteux est l'enregistrement de serveur de noms. Les domaines qui utilisent Route 53 possèdent des enregistrements NS de la famille ns-XXX.awsdns-XX.com, un motif trivial à repérer dans un fichier de zone. Le deuxième est l'adresse IP : AWS publie ses plages allouées dans un fichier exploitable par machine à l'adresse ip-ranges.amazonaws.com ; résoudre un domaine puis tester le résultat face à ces blocs CIDR permet de capter les points de terminaison EC2, S3 et CloudFront, quel que soit l'opérateur du DNS. Le troisième, et le plus coûteux, est l'inspection des en-têtes HTTP — Server: AmazonS3 ou la présence de X-Amz-Cf-Id — qui exige une requête réelle par domaine.

Si ces trois méthodes coexistent, c'est qu'elles couvrent des populations différentes. La correspondance par serveur de noms passe à côté de tout domaine qui utilise Cloudflare ou le DNS d'un registrar tout en faisant tourner son infrastructure sur EC2. La correspondance par IP rate les domaines placés derrière un CDN tiers qui masque une origine AWS. L'inspection des en-têtes capte les cas masqués par un CDN que les deux autres manquent, mais elle ne peut pas être exécutée à faible coût sur des centaines de millions de domaines. Un pipeline sérieux applique les filtres bon marché à l'ensemble de la zone et réserve les vérifications d'en-têtes à la liste restreinte.

Sources de données : fichiers de zone et données enrichies

Les trois méthodes partent du même point : une liste des domaines de la zone qui vous intéresse. Le catalogue WebTrackly couvre 716 fichiers de zone TLD et 716 jeux enrichis correspondants, soit 285,582,781 domaines toutes zones confondues. La zone .com à elle seule en compte 163,422,083. Les packs enrichis incluent les champs NS et IP, ce qui signifie que les deux premières méthodes d'identification ci-dessus s'exécutent directement sur le CSV téléchargé, sans aucune résolution DNS de votre côté.

Quelle que soit la voie choisie, la fraîcheur compte. Pour la prospection par e-mail à froid en particulier, une liste de domaines ne vaut que par la validation de ses MX, et les enregistrements MX changent sans préavis — revérifiez la délivrabilité la semaine même de l'envoi. WebTrackly exporte chaque fichier au moment de l'achat plutôt que de servir un instantané pré-généré : les données reflètent donc l'état actuel de la zone.

La subtilité des ccTLD

Les fichiers de zone des ccTLD sont nettement plus difficiles à obtenir que ceux des gTLD. De nombreux registres nationaux ne publient jamais de zone publique, et d'autres imposent des restrictions d'accès, des accords ou des frais qui rendent l'acquisition directe impraticable. Le .de allemand et le .fr français en sont les exemples les plus connus, mais le schéma se répète dans une grande partie de l'espace des codes pays. Les données agrégées sont la seule voie viable pour couvrir ces zones, ce qui explique pourquoi la disponibilité par TLD est inégale chez tous les acteurs de ce marché.

Prêt à analyser l'hébergement sur de vraies données de zone ? WebTrackly propose des téléchargements instantanés de fichiers de zone TLD et de données de zone enrichies avec les champs NS, MX, IP et CMS. Les packs démarrent à $3.50.

Voir les packages de données

Filtrer le bruit : les domaines récemment enregistrés

Un flux brut de domaines récemment enregistrés est bruité. Une large part des nouveaux enregistrements sont des domaines parkés, des pages PPC ou des noms abandonnés en quelques semaines : utiliser une liste brute pour la prospection gaspille donc une bonne partie de l'effort. Le filtre le plus rentable repose sur les serveurs de noms : les domaines récemment enregistrés qui pointent vers des serveurs de parking connus comme ns1.sedoparking.com peuvent être écartés en bloc, sans aucune requête réseau. Les schémas de registrar recoupent les mêmes grappes ; combiner les deux élimine l'essentiel des déchets en une seule passe hors ligne.

La fraîcheur avant le volume

Les places de marché se vendent au volume, mais pour le travail sur les domaines récemment enregistrés, c'est l'âge des données qui détermine le résultat. Un dump vendu comme « récemment enregistré » peut avoir été constitué des mois plus tôt ; à ce stade, la propriété intéressante — le fait qu'il s'agisse d'entreprises en phase de démarrage — ne s'applique plus. Un export plus petit mais récent constitue une meilleure entrée : c'est la logique derrière la génération des fichiers à l'achat plutôt que la livraison d'une archive.

Pourquoi identifier AWS est plus difficile qu'il n'y paraît

Deux complications reviennent systématiquement. La première est le découplage entre DNS et hébergement : un grand nombre de domaines utilisent un fournisseur DNS tiers tout en routant leur trafic vers AWS, si bien que la correspondance par serveur de noms sous-estime systématiquement le total. Corréler les IP résolues avec les plages AWS publiées corrige le problème, ce qui suppose de maintenir ces plages à jour — le fichier JSON évolue régulièrement au fil des capacités ajoutées et retirées.

La seconde est que les plages AWS couvrent de nombreux services aux significations différentes. Un domaine qui se résout dans une plage CloudFront vous indique qu'il utilise un CDN ; un domaine qui se résout dans une plage EC2 d'une région donnée vous dit tout autre chose sur l'endroit où tourne réellement la charge de travail. Traiter « sur AWS » comme un simple booléen fait perdre l'essentiel du signal contenu dans les données.

À retenir

  1. Partez des données de zone, pas d'un crawler. La correspondance par serveur de noms et par IP sur un extrait de zone complet couvre la majorité des domaines hébergés sur AWS pour un coût négligeable. Réservez les vérifications HTTP aux cas que les filtres bon marché ne permettent pas de trancher.
  2. Gardez les plages IP AWS à jour. Récupérez ip-ranges.json à intervalles réguliers plutôt que de coder les CIDR en dur. Des plages obsolètes produisent des faux négatifs qui ressemblent à de véritables absences.
  3. Segmentez par service, pas seulement par fournisseur. Distinguez les signaux Route 53, CloudFront, S3 et EC2. « Utilise AWS » est un critère bien plus faible que « fait tourner EC2 dans eu-west-1 ».
  4. Filtrez les NRD avant toute chose. Éliminez d'abord les serveurs de noms de parking et les grappes d'enregistrements en masse. Tout ce qui suit dans la chaîne coûte moins cher.
  5. Validez les MX juste avant la prospection. Utilisez le champ MX du CSV enrichi pour la passe hors ligne, puis un service de vérification comme ZeroBounce ou Email Hippo pour le contrôle en direct. WebTrackly ne vend ni fiches de contact, ni adresses e-mail, ni numéros de téléphone — uniquement des données au niveau du domaine.

Questions fréquentes

Q : WebTrackly vend-il une liste de domaines AWS prête à l'emploi ?

R : Pas sous un libellé « AWS ». Le catalogue comprend 79 listes de sites organisées par CMS et par technologie, ainsi que des packs de zone enrichis contenant les champs NS et IP, sur lesquels vous filtrez selon les motifs de serveurs de noms AWS et les plages IP publiées. La logique d'identification reste de votre côté, ce qui signifie aussi qu'elle reste sous votre contrôle à mesure que les plages AWS évoluent.

Q : Puis-je obtenir la liste complète des domaines d'un TLD donné ?

R : Pour les 716 TLD actuellement au catalogue, oui — voir zones pour les fichiers de zone bruts et données de domaines pour les versions enrichies. La couverture des ccTLD restreints est par nature plus étroite que celle des gTLD, pour les raisons de politique de registre décrites plus haut.

Q : Comment les données sont-elles livrées ?

Le format de téléchargement dépend du package et figure sur la page produit. Le fichier est généré au moment de l'achat. Les packs démarrent à $3.50 ; les utilisateurs réguliers peuvent opter pour Pro à $29/mois (50 packs, 10 jeux de données, 30K appels API) ou Enterprise à $99/mois (200 packs, 50 jeux de données, 300K appels API).

Q : Quelle est la meilleure façon de filtrer les domaines récemment enregistrés pour éviter le spam ?

R : Filtrez d'abord sur les motifs de serveurs de noms pour retirer les grappes de parking, puis sur le registrar, et vérifiez enfin que le domaine se résout vers autre chose qu'une page d'attente. Les deux premières étapes s'exécutent hors ligne sur le CSV et éliminent l'essentiel du bruit avant la moindre dépense en requêtes réseau.

Travaillez sur des données de domaines à jour plutôt que sur des dumps périmés. WebTrackly livre 1,538 packs — 716 fichiers de zone TLD, 716 jeux de zone enrichis, 79 listes de sites par technologie et 27 jeux de données sélectionnés — sous forme de téléchargements CSV instantanés.

Voir les packages de données

Partager cet article

Articles associés

Commentaires (0)

Laisser un commentaire

Aucun commentaire pour le moment. Soyez le premier à commenter !

support_agent
WebTrackly Support
Usually replies within minutes
Bonjour !
Envoyez-nous un message, nous vous répondrons au plus vite.