IA : le pillage des créateurs était un risque calculé, et assumé
Content changed
Changes
Texte rédigé avec une IA, sous la direction et la responsabilité de Damien Van Achter. Son rapport de fabrication est en fin d'article.
Pour empêcher une intelligence artificielle d'aspirer un site, il existe un geste officiel. On dépose à la racine un fichier nommé robots.txt, on y écrit le nom des robots collecteurs qu'on refuse, et on attend. C'est ce que recommandent les hébergeurs, ce que proposent les plateformes d'édition sous forme de case à cocher, et ce que l'Union européenne a placé au centre de sa protection des créateurs.
Le geste est le même pour tout le monde. Un blog personnel, un photographe qui met son portfolio en ligne, une newsletter indépendante, un site d'archives associatif, un quotidien national: tous disposent exactement du même outil, et de rien d'autre.
Ce fichier n'a aucun pouvoir. Il ne bloque rien, ne verrouille rien, ne déclenche aucune alarme. C'est un panneau posé sur un terrain sans clôture. Il fonctionne aussi longtemps que celui qui passe décide de le lire.
Des documents parus ces derniers mois montrent ce que deux des plus gros acteurs du secteur ont fait de ce panneau. Et surtout, qu'ils l'ont fait après avoir posé le coût et le bénéfice dans la balance.
Ce qu'ils ont promis à l'Europe
En juillet 2025, la Commission européenne publie un code de bonnes pratiques destiné aux entreprises qui entraînent des modèles d'IA. Deux engagements y sont écrits noir sur blanc. Ne pas contourner les murs payants. Employer des robots collecteurs qui lisent et suivent les instructions du robots.txt.
Vingt et un fournisseurs l'ont signé. Parmi eux, Microsoft et OpenAI.
Ce qu'un dossier judiciaire en dit
Le 17 septembre 2026, un tribunal fédéral de New York a rendu publique une pièce de 92 pages dans le procès que lui intentent le New York Times, le Daily News, The Intercept et deux autres éditeurs. C'est un document de partie, écrit par les avocats des plaignants, et rien de ce qu'il affirme n'a été jugé. Il s'appuie sur des courriels et des documents internes obtenus pendant l'instruction.
Sur les murs payants, il rapporte un échange. Un chercheur d'OpenAI signale au président de l'entreprise, Greg Brockman, l'existence d'« un moyen de contourner le mur payant du nytimes ». Brockman répond, en trois lettres: « ah nice ». Le document montre aussi des captures de la boutique d'assistants d'OpenAI, où l'on trouvait des outils appelés « Bypass Paywall » et « Remove Paywall ».
Sur le robots.txt, le mémorandum décrit une méthode plus simple que la désobéissance: ne pas passer par la porte. En récupérant les articles dans des archives constituées par des tiers, comme Common Crawl, une entreprise obtient le contenu sans jamais visiter le site, donc sans jamais rencontrer le fichier qui lui aurait dit non. Les éditeurs affirment avoir suivi à la lettre les instructions de retrait publiées par les deux entreprises, et avoir continué à voir leurs pages collectées.
Et l'Europe le savait
En juillet 2026, la Commission a publié une étude qu'elle avait commandée à deux cabinets sur la possibilité de créer un registre européen des refus. Le document repose sur 58 entretiens dans les secteurs de la création. Son glossaire définit le robots.txt en une phrase: le protocole « n'est pas un mécanisme de réservation de droits », et il n'est « pas systématiquement respecté ».
Le reste est du même ordre. Les mécanismes de refus existants sont jugés « insuffisamment efficaces en pratique ». Les signaux posés à la racine d'un site sont trop grossiers et « ne persistent pas lorsque les œuvres sont copiées, reformatées ou redistribuées ». Ceux qu'on attache à une image ou à un texte sont « souvent altérés ou retirés à grande échelle ».
L'étude décrit surtout le trajet exact que le dossier new-yorkais documente. Un refus n'a pas d'effet rétroactif: il ne peut pas être respecté s'il est exprimé après que les données ont déjà été récupérées, « que ce soit par collecte ou par des jeux de données tiers ». Une fois qu'un texte est entré dans un modèle, en retirer l'influence est considéré comme techniquement irréalisable. Un développeur interrogé pour l'étude explique travailler à partir d'archives pré-collectées et cite Common Crawl. Un autre indique que la plupart de ces archives ne conservent aucune trace des refus.
Dernier point, et le plus lourd pour qui publie: personne ne peut vérifier. L'étude constate que les créateurs « manquent d'outils pour vérifier si leurs refus sont respectés ». Un refus ignoré ne laisse aucune trace du côté de celui qui l'a exprimé.
Un calcul, pas un accident
Le dossier ne décrit pas des entreprises prises de court par une technologie qu'elles maîtriseraient mal. Il décrit des gens qui ont analysé la situation, écrit ce qu'ils en pensaient, et continué.
Le directeur de la recherche appliquée de Microsoft, Brent Hecht, écrit dans un document interne rédigé peu après le dépôt de la plainte new-yorkaise: « Notre stratégie de contenu IA a enclenché une boucle infernale qui va dégrader les performances de nos modèles et le web tout entier en même temps. Il est très inhabituel qu'un produit final menace les fondements économiques de ses fournisseurs essentiels, mais c'est la situation que nous avons créée. » Le même dirigeant qualifie ailleurs la collecte de « vol d'une ampleur sans précédent », et peut-être, écrit-il, du « plus grand vol de travail de l'histoire de l'humanité ». Ces phrases n'ont pas été prononcées par des critiques extérieurs. Elles ont été écrites à l'intérieur, par quelqu'un dont c'est le métier de comprendre, et elles n'ont rien arrêté.
La suite éclaire le calcul. Selon le mémorandum, immédiatement après le dépôt des plaintes, OpenAI a recherché et copié les contenus des plaignants les plus susceptibles de ressortir de ses modèles, pour construire un filtre destiné à en bloquer la restitution. Et, écrivent les avocats des éditeurs: « OpenAI n'a supprimé la restitution du contenu d'aucune entité qui ne l'avait pas attaquée en justice. » Brent Hecht, chez Microsoft, s'en inquiétait et parlait d'« étouffement involontaire », puisque le procédé aboutit à ce que « les gens qui ont un droit sur le contenu aient moins de visibilité sur ce qui a servi à l'entraînement ».
Le seuil de déclenchement n'est donc pas le refus, ni le droit, ni la demande polie. C'est l'assignation. Ce que ce dossier documente, c'est un arbitrage économique ordinaire: la ressource est prise parce qu'elle rapporte davantage que ce qu'elle risque de coûter, un jour, peut-être, si un tribunal finit par trancher, et à condition que quelqu'un ait eu les moyens d'aller jusque-là. Le ministère de la Justice américain a d'ailleurs exposé la logique à sa façon en prenant la défense des entreprises: payer des licences, écrit-il, freinerait l'innovation et placerait les sociétés américaines en situation de désavantage concurrentiel.
Ce calcul est cynique au sens exact du terme: il ne nie pas le tort, il le provisionne. Le travail d'autrui n'y figure pas comme un droit à respecter, mais comme une ligne de risque à tenir. Et il est méprisant de façon très concrète, puisqu'il trie. Le New York Times a des avocats et a obtenu son filtre. Le photographe indépendant, la newsletter à deux cents abonnés, le site d'archives tenu par trois bénévoles ont exprimé le même refus, dans le même fichier, et n'ont obtenu que le silence.
Pourquoi le risque reste faible
Le code signé par Microsoft et OpenAI est volontaire, et il précise lui-même que l'adhésion « ne constitue pas une conformité au droit de l'Union en matière de droit d'auteur ». Un signataire peut d'ailleurs le quitter quand il veut: la liste comptait vingt-six noms en août 2025, elle en compte vingt et un aujourd'hui. Le règlement européen sur l'IA , lui, oblige bel et bien à respecter les refus, mais les modèles commercialisés avant août 2025, ceux dont il est question ici, ont jusqu'en août 2027 pour s'y conformer.
Surtout, aucun juge européen n'a encore dit ce qu'est un refus valable. Le tribunal de Munich a condamné OpenAI en novembre 2025 dans l'affaire des paroles de chansons, mais sur un autre terrain. La question du refus avait été plaidée, OpenAI soutenant que le robots.txt était le standard du marché. Le tribunal n'a pas eu à trancher. Restent deux définitions concurrentes de ce qui vaut refus, et celle qui s'applique en pratique est celle du collecteur.
Et maintenant?
Face à ces enjeux, plusieurs pistes d'action systémique se dessinent.
💪 Garder la trace de son refus, à défaut de pouvoir le faire respecter.
Exprimer son refus par plusieurs canaux et en conserver une preuve datée ne bloque personne, et le prétendre serait mentir. L'intérêt est ailleurs: un refus daté est ce qui manque à tout le monde le jour où la question se pose devant un juge, ou simplement le jour où l'on veut démontrer un écart. C'est la seule chose qui se construise sans attendre que quiconque bouge.
On saura que ça marche quand la date d'un refus deviendra un élément discuté devant un juge.
🤘 Mettre les journaux de serveur en commun.
Chaque site conserve la trace de qui est venu chercher quoi, et quand. Pris isolément, ces relevés ne prouvent rien. Comparés entre plusieurs éditeurs sur une même période, ils rendent visible l'écart entre le refus déclaré et la collecte constatée, qui est précisément ce que l'étude européenne décrit comme invérifiable. Les compétences existent déjà dans les services techniques des rédactions et dans les laboratoires qui travaillent sur les données d'entraînement.
On saura que ça marche quand cet écart sera documenté par plusieurs sites sur une même période.
✊ Poser la question du refus à un juge européen.
Munich a laissé la question ouverte. Tant qu'aucune décision ne dit si un robots.txt, des métadonnées ou des conditions générales valent refus, chacun campe sur sa définition, et celui qui collecte garde l'avantage. Une société de gestion, une fédération d'éditeurs ou un ayant droit isolé peuvent la poser frontalement, en choisissant un cas où le refus a été exprimé par plusieurs canaux et horodaté.
On saura que ça marche quand une décision européenne dira ce qui vaut refus.
Ces pistes ne sont pas des recettes toutes faites, mais des points d'entrée pour repenser nos systèmes numériques selon une logique de liberté positive: non pas limiter, mais augmenter nos capacités collectives d'action.
Publié le 18 septembre 2026 à 10:03. Signé et assumé par Damien Van Achter. Rédaction par Claude (Anthropic) dans Claude Code, sous le cadre éditorial FLTR.
En une phrase. La prose a été rédigée par la machine. L'intention, l'angle, la structure, les coupes, la qualification morale, le titre et la décision de publier viennent de l'auteur. Les 60 affirmations factuelles ont été vérifiées sur sources primaires avant la rédaction.
Parcours
06:40 auteur Intention, à partir du radar du matin: « je veux creuser l'info microsoft open ia sur le vol de contenus ».
06:50 machine Lecture des sources primaires, sujet et angle proposés, tableau de claims ouvert.
06:59 auteur Angle validé. Arbitrage de structure: le volet ministère de la Justice américain réduit à un paragraphe de contexte.
07:16 auteur Plan et besoins du lecteur validés, feu vert pour rédiger.
07:20 machine Version 1: 2 329 mots.
07:29 auteur Rejet sur la forme: « c'est chiant au possible, ça jargonne, ca cite des texte de lois toutes les 2 lignes, ça tourne autour du pot ». Question posée: ce que le lecteur en retire.
07:30 machine Version 2: 1 194 mots, références juridiques renvoyées en liens.
07:44 auteur Trois ajouts de fond: tous les producteurs, du blog au groupe de presse; le calcul coût-bénéfice; la qualification: « cynique et profédément irrespctueuse ».
09:20 machine Version 3: 1 710 mots, section « Un calcul, pas un accident », partie juridique ramenée de quatre à deux paragraphes.
09:37 auteur Titre imposé: « IA: le pillage des créateurs était un risque calculé, et assumé ».
09:40 auteur Relecture et programmation dans l'éditeur Ghost, avec la carte « à propos » de fin, texte de l'auteur. Publication à 10:03.
Heures de l'auteur tirées du transcript de la session; heures de la machine déduites des fichiers, à quelques minutes près. Citations de l'auteur reproduites telles qu'écrites, fautes de frappe comprises.
Vérification
60 affirmations, toutes vérifiées sur sources primaires: mémorandum judiciaire de 92 pages, code de bonnes pratiques (empreinte SHA-256 du PDF relevée), règlement sur l'IA, étude de la Commission, jugement de Munich.
Quatre vérifications menées en parallèle par des agents distincts.
Corrections issues de la vérification: une citation du code qui était tronquée; « 26 signataires » reformulé en comparaison de deux relevés datés (26 en août 2025, 21 en septembre 2026); une formulation de la veille sur un affaiblissement de l'opt-out, retirée faute de base.
Trois erreurs repérées dans les reprises de presse, écartées: pièce dite « non caviardée » alors qu'elle l'est, un « perhaps » disparu des titres, une citation attribuée à la mauvaise personne.
Choix et limites
Laissé hors de l'article, alors que vérifié: volumes de copies, chutes de trafic, volet Suno, calendrier des sanctions.
Limite déclarée dans le texte: une pièce de partie, dont rien n'a été jugé.
Incident: l'envoi aux 557 abonnés est parti sans sa carte d'introduction. Règle corrigée depuis.
Détecteur Pangram 4.0, le 24 septembre: 88 % IA. Seul le bloc de fin, écrit par l'auteur, est jugé humain. Le résultat est cohérent avec ce parcours.
Cadre
Charte éditoriale, grille d'analyse, règles de vérification et interdits de style écrits par l'auteur et appliqués à chaque session: 57 modifications versionnées de ces règles depuis le 7 février 2026, dont plusieurs nées d'erreurs corrigées sur des articles précédents.
Pièces
Tableau de claims, plan avec historique des révisions, trois versions successives, sources archivées, transcript horodaté de la session, sauvegarde versionnée du 18 septembre. Aucun horodatage par un tiers: ces pièces sont crédibles, pas opposables.
À votre jugement
Ce rapport montre qui a décidé quoi, pas si ces décisions étaient bonnes. L'angle tient-il face aux pièces? Les coupes ont-elles écarté quelque chose qui aurait dû figurer? La qualification « cynique » est-elle portée par les faits cités?
Rapport établi le 24 septembre 2026.
Rapport de fabrication (qui a décidé quoi, ce qui a été vérifié)
NewsDiff