Scraping DGFiP : quand l'alerte de l'ANSSI révèle la fragilité souveraine de nos SI d'entreprise
Date Published

# Scraping DGFiP : quand l'alerte de l'ANSSI révèle la fragilité souveraine de nos SI d'entreprise
> *En 2026, l'ANSSI a formellement alerté les organisations françaises sur des campagnes de scraping ciblant les données exposées via les interfaces de la Direction Générale des Finances Publiques. Pour les équipes IT des PME et ETI, ce signal d'alarme va bien au-delà d'un simple incident de sécurité. Il met à nu une question structurelle que beaucoup préfèrent encore esquiver : qui contrôle réellement les données de votre entreprise, et depuis quelles infrastructures ?*
L'alerte ANSSI, symptôme d'un problème plus vaste que la DGFiP
Lorsque l'ANSSI publie une note d'alerte sur une pratique aussi spécifique que le scraping des données DGFiP, il serait tentant de la traiter comme un bulletin de sécurité parmi d'autres — à lire, archiver, oublier. Ce serait une erreur de lecture. Derrière la cible technique (les API et interfaces d'interrogation des données fiscales et d'immatriculation des entreprises françaises), c'est une mécanique d'exfiltration structurée que l'agence documente. Des acteurs automatisent la collecte de données d'entreprises françaises — SIREN, données financières déclarées, informations dirigeants — à une échelle et une fréquence que les systèmes publics n'ont pas été conçus pour absorber ni détecter.
La question que les DSI doivent se poser n'est pas : « Sommes-nous directement visés par ce scraping ? » Elle est : « Nos propres systèmes d'interrogation de ces sources publiques sont-ils traçables, maîtrisés, souverains ? » Et plus radicalement : « Les tiers auxquels nous avons délégué ces accès — éditeurs de logiciels comptables, plateformes de conformité, outils de KYC — depuis quelles infrastructures opèrent-ils réellement ? »
C'est là que le vernis craque.
La délégation silencieuse : comment les PME ont externalisé leur exposition sans le savoir
Depuis une décennie, les équipes IT des PME et ETI ont massivement adopté des outils SaaS pour automatiser les flux de données fiscales et comptables. Synchronisation automatique avec les référentiels publics, vérification de la solvabilité des fournisseurs, contrôle de TVA intracommunautaire, rapprochement des données d'immatriculation — tout cela passe désormais par des connecteurs, des API tierces, des plateformes de données business.
Le problème n'est pas fonctionnel. Ces outils fonctionnent. Le problème est géographique et juridique. Une part significative de ces plateformes — notamment celles spécialisées dans l'enrichissement de données B2B et la conformité — opèrent depuis des infrastructures hébergées hors Union Européenne, ou sont adossées à des stacks cloud américaines soumises au CLOUD Act. Quand votre outil de conformité interroge la DGFiP pour vérifier les données d'un fournisseur, où transitent ces données ? Dans quel datacenter sont-elles temporairement stockées ? Sous quelle juridiction tombent-elles ?
La majorité des DSI de PME ne peuvent pas répondre à cette question. Non par négligence, mais parce que ces informations sont enfouies dans des conditions générales que personne ne lit, dans des sous-traitants de rang 3 jamais audités, dans des architectures que les éditeurs ne documentent pas spontanément.
L'alerte ANSSI sur le scraping DGFiP est donc aussi une alerte sur ce que l'on pourrait appeler la délégation silencieuse : le transfert implicite de la maîtrise des données sensibles vers des acteurs dont la souveraineté n'a jamais été questionnée, parce que le service rendu était fluide et le prix acceptable.
Ce que ça change concrètement pour les équipes IT : cartographier ce qu'on ne voit plus
La réponse opérationnelle à cette alerte n'est pas de couper les accès aux sources DGFiP. Ce serait se priver d'un levier de conformité légitime. La réponse est de reprendre la cartographie des flux de données que l'automatisation a rendu invisibles.
Concrètement, cela signifie plusieurs chantiers que les équipes IT doivent désormais inscrire dans leur backlog — et pas dans la pile « un jour, peut-être » :
Identifier les tiers qui interrogent les référentiels publics en votre nom. Chaque outil qui se connecte à la DGFiP, à l'INSEE, à Infogreffe, ou à leurs équivalents européens, le fait depuis quelque part. Ce « quelque part » a une importance légale depuis le RGPD, et une importance stratégique depuis que le CLOUD Act a montré qu'une donnée hébergée aux États-Unis peut être légalement saisie par une autorité américaine, même si elle appartient à une entreprise européenne.
Exiger la transparence contractuelle sur la chaîne d'hébergement. Il ne s'agit pas de demander si l'éditeur est « conforme RGPD » — cette question ne suffit plus. Il s'agit d'exiger, contractuellement, la liste des sous-traitants de rang 2 et 3, et la localisation effective des traitements. Un éditeur qui ne peut pas répondre à cette question en 2026 n'est pas un partenaire souverain. C'est un risque.
Revoir les droits d'accès accordés aux connecteurs automatisés. Beaucoup de synchronisations avec les référentiels publics fonctionnent encore avec des credentials partagés, des tokens à durée de vie longue, des accès sans logs applicatifs côté SI interne. Le scraping que documente l'ANSSI exploite précisément ce type de surface d'exposition mal contrôlée.
Ce travail de cartographie n'est pas glamour. Il n'y a pas d'outil magique qui le fait à votre place — ou plutôt, les outils qui prétendent le faire automatiquement méritent d'être soumis aux mêmes questions que les autres. C'est un travail d'enquête, de documentation, parfois de renégociation contractuelle. C'est aussi, précisément, le travail que les équipes IT ont progressivement abandonné à mesure que le SaaS « clé en main » rendait la question de l'infrastructure invisible.
La souveraineté des données d'entreprise n'est pas une question philosophique, c'est une question de compétitivité
Il faut nommer ce que le scraping massif des données DGFiP peut produire à grande échelle : une cartographie détaillée du tissu économique européen, de ses acteurs, de leurs santé financière déclarée, de leurs dirigeants, de leurs relations capitalistiques. Ces données, agrégées et enrichies, ont une valeur considérable — pour les acteurs de l'intelligence économique, pour les fonds d'investissement, pour les acteurs commerciaux qui cherchent à identifier des cibles d'acquisition ou de démarchage.
La question n'est pas paranoïaque. Elle est stratégique. Qui profite d'une cartographie exhaustive et automatisée des PME et ETI européennes ? Pas nécessairement des acteurs européens.
Les entreprises américaines et les fonds de capital-risque anglo-saxons investissent massivement depuis des années dans des plateformes de « business intelligence » qui agrègent des données publiques européennes. Ces plateformes sont légales, dans la mesure où elles exploitent des données officiellement publiques. Mais leur utilisation à des fins d'acquisition, de démarchage commercial agressif ou d'intelligence concurrentielle sur le tissu industriel européen pose une question de réciprocité que les institutions européennes peinent encore à formuler clairement.
Pour un DSI ou un RSSI de PME, cela se traduit par une question très concrète : les données que votre entreprise rend accessibles via ses interactions avec les référentiels publics contribuent-elles à alimenter des bases de données dont vous n'avez pas la maîtrise, et qui peuvent être retournées contre vos intérêts commerciaux ?
La réponse honnête, dans beaucoup de cas, est : probablement, partiellement, et vous n'avez pas de moyen simple de le savoir.
Que font les alternatives européennes — et pourquoi la question mérite d'être posée sans angélisme
Face à ce constat, la tentation est d'opposer les « bons » acteurs européens aux « mauvais » acteurs américains. Ce serait une simplification contre-productive. Le marché européen des solutions de conformité, d'enrichissement de données B2B et de connecteurs fiscaux n'est pas exempt de failles souveraines. Des éditeurs européens hébergent sur AWS ou Azure. Des solutions labelisées « cloud français » délèguent des traitements à des sous-traitants dont la chaîne d'hébergement mérite d'être auditée.
L'enjeu n'est donc pas de remplacer un acteur américain par un acteur européen de manière aveugle, en espérant que le changement de drapeau règle la question. L'enjeu est d'exiger, de tout acteur quel que soit son origine, une traçabilité réelle de la chaîne de traitement des données.
Cela dit, des acteurs européens spécialisés dans la gestion souveraine des données fiscales et comptables existent et montent en maturité. Certains — comme Signaux Faibles côté public, ou des éditeurs de solutions de conformité B2B hébergées dans des clouds certifiés SecNumCloud — proposent des architectures où la question de la localisation des données n'est pas une promesse marketing mais un engagement contractuel auditable.
La différence, pour une équipe IT, est opérationnelle autant que juridique : avec un acteur dont la chaîne d'hébergement est documentée et localisée en Europe, vous pouvez construire une réponse à un audit RGPD, à une question de votre RSSI, ou à une demande de votre DG, sans fouiller pendant trois semaines dans des CGU rédigées en anglais de Californie.
C'est une différence de maîtrise du SI. Pas de performance fonctionnelle.
Ce que l'ANSSI ne dit pas — et ce que les DSI doivent entendre entre les lignes
Les alertes de l'ANSSI sont, par nature, mesurées. Elles documentent des menaces, proposent des recommandations techniques, évitent les postures politiques. C'est leur rôle institutionnel. Mais entre les lignes de cette alerte sur le scraping DGFiP, il y a un message plus structurel que les équipes IT des PME et ETI doivent s'approprier.
Nous sommes entrés dans une phase où les données des entreprises européennes — y compris les données « publiques » issues de leurs obligations légales et fiscales — sont devenues une ressource stratégique que des acteurs tiers cherchent à collecter, agréger et monétiser à une échelle industrielle. Les outils dont ces acteurs disposent — automatisation, IA, infrastructures cloud scalables — rendent cette collecte plus rapide, plus exhaustive et plus discrète que jamais.
Face à cela, la posture réactive — attendre l'alerte de l'ANSSI, appliquer le correctif, passer à autre chose — n'est plus suffisante. Ce qu'elle révèle, c'est l'urgence d'une posture active : reprendre la cartographie de ses flux de données, exiger la transparence de sa chaîne de sous-traitance numérique, et traiter la souveraineté des données non pas comme une contrainte réglementaire mais comme un actif stratégique à protéger.
Pour les DSI et RSSI qui lisent encore les bulletins de sécurité comme une liste de patchs à appliquer : le patch, ici, c'est une révision de votre doctrine d'achat IT et de votre cartographie des risques tiers. Ce n'est pas un ticket. C'est un chantier.
*RiffLab Media est un média B2B indépendant. Cet article ne constitue pas un conseil juridique. Les équipes IT sont invitées à se rapprocher de leur DPO et de leur conseil juridique pour toute décision relative à la gestion des données fiscales et des accès aux référentiels publics.*
Cet article vous a été utile ?
Recevez chaque vendredi nos analyses sur les alternatives souveraines SaaS. Pas de spam.
Pas de spam. Désinscription en un clic. Données hébergées en Europe.