IA générative, webscraping et blockchain

Les nouvelles orientations de l’EDPB

Une donnée accessible sur Internet n’est pas forcément une donnée que l’on peut utiliser librement pour entraîner une intelligence artificielle. C’est le message central du projet de lignes directrices sur le web scraping dans le contexte de l’IA générative que le Comité européen de la protection des données (EDPB) a adopté lors de sa séance plénière du 8 juillet 2026, et soumis à consultation publique jusqu’au 30 octobre 2026. Le texte s’attaque à une pratique devenue le socle de l’IA générative : le web scraping, c’est-à-dire la collecte automatisée et massive de contenus publiés sur le web pour constituer des jeux de données d’entraînement.

Cet article présente les principaux apports de ce projet, ses implications concrètes pour les entreprises, et les raisons pour lesquelles la mise en conformité relève autant de la protection des investissements que de l’obligation juridique.

Pourquoi le RGPD s'applique aux données publiquement accessibles

L’idée reçue la plus répandue en matière de scraping tient en une phrase : « ces données sont publiques, donc je peux les utiliser ». Le raisonnement est juridiquement faux, et l’EDPB le rappelle sans ambiguïté. Dès lors que les informations collectées permettent d’identifier une personne, directement ou indirectement, il s’agit de données personnelles, et leur collecte, leur stockage, leur organisation comme leur réutilisation constituent des traitements soumis au RGPD. Le caractère public de la source ne fait pas disparaître les droits des personnes concernées.

La conséquence pratique est immédiate : toute organisation qui collecte des données sur le web pour entraîner, affiner ou enrichir un système d’IA doit pouvoir justifier ce traitement. Cela vaut pour les grands développeurs de modèles de langage, mais aussi pour toute entreprise qui constitue son propre jeu de données, qui affine un modèle existant sur des données scrapées, ou qui fait appel à un prestataire pour le faire. Dans ce dernier cas, la première question à trancher est celle des rôles : qui est responsable du traitement, qui est sous-traitant, et les acteurs sont-ils responsables conjoints ?

De cette qualification découlent les obligations de chacun.

European Union flag fluttering beneath the Cinquantenaire Arch in Brussels, Belgium.

L'intérêt légitime, base légale de référence, mais sous conditions

scraping des données

Sur quelle base légale fonder un scraping à grande échelle ?

Le consentement, base reine du RGPD, est en pratique inaccessible : on ne peut pas recueillir l’accord préalable de millions de personnes dont on collecte les publications de manière indiscriminée. Reste l’intérêt légitime, que l’EDPB reconnaît comme la base la plus réaliste pour ce type de traitement, tout en encadrant strictement son invocation. Sur ce point, les lignes directrices prolongent et précisent, avec des exemples propres au scraping, l’avis que le Comité avait consacré aux modèles d’IA.

L’entreprise doit réussir un test en trois étapes. Elle doit d’abord démontrer un intérêt réel et clairement défini : développer un système d’IA pour une finalité précise peut en être un, à condition que cette finalité soit explicite et documentée. Elle doit ensuite établir la nécessité du traitement : la collecte envisagée est-elle indispensable, ou existe-t-il une solution moins intrusive pour atteindre le même objectif ? Elle doit enfin procéder à la mise en balance entre son intérêt et les droits et libertés des personnes concernées, et cette pesée ne doit pas tourner au détriment de ces dernières.

C’est dans cette mise en balance que les mesures de protection prennent toute leur importance. L’EDPB indique que des garanties concrètes peuvent faire pencher la balance du bon côté : exclusion de certaines catégories de données dès la collecte, transparence renforcée sur les activités de scraping, limitation des volumes collectés, anonymisation ou pseudonymisation les plus précoces possibles. Autrement dit, la licéité du scraping ne se décrète pas, elle se construit par les précautions prises à chaque étape.

La minimisation commence avant la collecte

L’un des apports les plus concrets du projet de lignes directrices tient à sa lecture du principe de minimisation. Celui-ci ne se limite pas à trier les données après coup : il s’applique avant, pendant et après la collecte.

Avant la collecte, l’entreprise doit se demander si le scraping est réellement nécessaire, et notamment si des données synthétiques pourraient suffire à son besoin. Elle doit définir des critères de collecte précis plutôt que d’aspirer le web sans discernement. Pendant la collecte, des filtres d’exclusion doivent écarter ce qui n’a pas à être capté, et certaines sources doivent être évitées d’office : les sites structurellement susceptibles de contenir des données sensibles, les sites destinés aux mineurs, et ceux qui s’opposent clairement au scraping. Après la collecte, le tri, la suppression et l’anonymisation prolongent la démarche.

minimisation des données

Les données sensibles : pas d'exemption générale

Données sensibles

Sur les données dites sensibles (santé, opinions politiques, orientation sexuelle, données biométriques, entre autres), le projet de lignes directrices ferme la porte à toute lecture accommodante. Leur traitement est en principe interdit, sauf exceptions strictes : il exige à la fois une base légale au titre de l’article 6 du RGPD et une exception prévue par l’article 9, paragraphe 2. Et l’EDPB précise qu’il n’existe aucune exemption générale pour le scraping.

Le Comité admet cependant une réalité pratique : malgré les filtres, une collecte massive peut capter des données sensibles de manière accidentelle et marginale. S’appuyant sur l’arrêt GC e.a. de la Cour de justice de l’Union européenne (C-136/17), l’EDPB suggère que cette collecte incidente ou résiduelle peut être tolérée au cas par cas, à des conditions exigeantes : le responsable doit agir dans le cadre de ses responsabilités, de ses compétences et de ses possibilités, et démontrer qu’il a mis en place des mesures techniques et organisationnelles pour éviter cette collecte, supprimer rapidement les données concernées lorsqu’elles sont détectées, et empêcher leur diffusion. La tolérance ne porte donc pas sur le principe, mais sur l’accident dûment encadré.

L'exactitude : des sources fiables, datées et validées

Le projet consacre aussi des développements au principe d’exactitude, souvent négligé dans les discussions sur le scraping. L’EDPB recommande trois pratiques concrètes : ne collecter que depuis des sources fiables, enregistrer l’horodatage de la collecte, et valider les données avant de les utiliser pour l’entraînement. La logique est simple : le web contient des informations fausses, périmées ou contradictoires, et un modèle entraîné sans précaution les absorbe. Pour l’entreprise, l’enjeu est double : la conformité au principe d’exactitude du RGPD, et la qualité même du système produit, un modèle nourri de données douteuses produisant des résultats douteux.

Données, sources fiables

Transparence et mémorisation : les obligations de bout en bout

transparence

Deux autres exigences méritent l’attention. La première concerne la transparence : lorsque l’information individuelle de chaque personne concernée s’avère impossible ou disproportionnée, ce qui est fréquent en matière de scraping, l’entreprise n’est pas pour autant dispensée d’informer. Elle doit alors rendre publiques des informations sur ses activités de collecte, accessibles à tous.

La seconde porte sur un risque propre aux modèles d’IA : la mémorisation. Un modèle entraîné sur des données personnelles peut, dans certaines conditions, restituer ces données dans ses réponses. L’EDPB attend des entreprises qu’elles mettent en place des mesures contre cette mémorisation et cette régurgitation, ce qui déplace l’obligation de conformité de la seule phase de collecte vers le comportement du modèle lui-même, tout au long de son cycle de vie.

De la contrainte à l'avantage concurrentiel

On pourrait lire ces exigences comme un empilement de contraintes. Ce serait passer à côté de leur portée économique. Un jeu de données collecté sans base solide est un actif fragile : l’entreprise peut être contrainte de le supprimer, de revoir son projet ou de réentraîner son modèle, et un investissement en IA peut alors perdre une grande partie de sa valeur. À l’inverse, la capacité à démontrer l’origine des données, la licéité de leur collecte et les protections mises en place renforce la confiance des clients, des partenaires et des régulateurs. Dans un marché où les questions sur la provenance des données d’entraînement se multiplient, cette traçabilité devient un argument commercial autant qu’un bouclier juridique.

La bonne question n’est donc plus « ces données sont-elles accessibles ? », mais « leur collecte et leur utilisation sont-elles nécessaires, proportionnées, transparentes et documentées ? »

Conclusion : le bon moment pour agir

Le projet de lignes directrices est soumis à consultation publique jusqu’au 30 octobre 2026, et sa version définitive en tiendra compte. Les entreprises concernées ont donc un double intérêt à s’en saisir dès maintenant : auditer leurs pratiques de collecte et leurs mécanismes de gouvernance à la lumière du texte, et, pour celles qui le souhaitent, contribuer à la consultation pour faire entendre leur réalité opérationnelle.

On notera enfin que l’EDPB a adopté, lors de la même séance plénière, des lignes directrices sur l’anonymisation. Les deux textes se répondent : l’anonymisation précoce figure précisément parmi les garanties qui pèsent en faveur de la licéité d’un scraping. Leur lecture conjointe s’impose à toute organisation concernée.

La conformité au RGPD n’est pas seulement une contrainte : elle contribue à protéger la valeur créée par les projets d’IA. Les lignes directrices de l’EDPB en fournissent désormais le mode d’emploi.

Foire aux questions (FAQ)

Il s'agit d'un texte adopté le 8 juillet 2026 par l'EDPB qui clarifie les obligations RGPD applicables au web scraping utilisé pour entraîner des systèmes d'IA générative. Il couvre notamment les bases légales, les principes de minimisation, d'exactitude et de transparence, ainsi que les règles applicables aux données sensibles.

Les deux textes sont actuellement soumis à consultation publique jusqu'au 30 octobre 2026. Les versions finales seront publiées après analyse des contributions reçues.

Pour les entreprises privées, l'intérêt légitime (article 6(1)(f) du RGPD) est généralement la base la plus adaptée. Il requiert de démontrer un objectif précis, la nécessité de la collecte et l'absence d'atteinte disproportionnée aux droits des personnes.

En principe, non : leur traitement est interdit, sauf à réunir à la fois une base légale (article 6 du RGPD) et une exception de l'article 9(2). Seule une collecte accidentelle et marginale peut être tolérée, au cas par cas, à condition que l'entreprise ait mis en place des mesures pour l'éviter, supprimer rapidement les données concernées et empêcher leur diffusion.

Toute organisation qui entraîne, ajuste ou enrichit un système d'IA avec des données provenant du web peut être concernée, pas uniquement les grands développeurs de modèles. Les start-ups, PME et institutions de recherche sont également visées.

Les contributions peuvent être soumises directement sur le site de l'EDPB, via les pages dédiées aux consultations publiques sur l'anonymisation et le web scraping, jusqu'au 30 octobre 2026.

Gouvernance d'abord

Risque, responsabilité et clarté des décisions avant les outils.

Capacités pérennes

Des systèmes internes qui perdurent, même quand les équipes changent.

IA responsable

Une adoption éthique, conforme et adaptée à votre contexte.

Approche programme

D'un état des lieux à un système réel, évolutif et ancré dans votre organisation.