Aller au contenu
Français
L'établiDes outils qui ne téléversent rien
Un atelier de l'association ODERSARien ne part, rien n'est gardé, rien ne nous arrive.

L'atelier · Nettoyer un PDF

Comment ça marche : Nettoyer un PDF

Un PDF ne range pas ses métadonnées à un seul endroit, il en a trois. L'outil les montre tous les trois, puis les vide, puis ROUVRE le fichier produit pour vous dire ce qui reste.

Ouvrir l'outil

Un PDF que vous envoyez emporte plus que ses pages. Il dit avec quel logiciel il a été fabriqué, sous quel nom de compte, à quelle date, et souvent à quelle heure exactement il a été enregistré pour la dernière fois. Un CV exporté depuis un traitement de texte peut porter le nom d'utilisateur d'un poste de travail, et un document repris d'un modèle peut porter le nom de la personne qui a fait le modèle.

Le vrai problème est ailleurs : ces informations sont écrites à TROIS endroits différents dans le fichier, et la plupart des outils n'en nettoient qu'un. Il y a la fiche classique du document, il y a un second bloc en XML qui répète souvent la même chose, et il y a ce que certains logiciels de mise en page collent sur chaque page. Un outil qui annonce « métadonnées supprimées » après n'avoir vidé que le premier ne ment pas volontairement : il ne sait pas.

Ici, les trois nids sont montrés avant d'être touchés, et l'outil ROUVRE le fichier qu'il vient de produire pour vous dire ce qui reste. C'est exactement ce que fait la visionneuse de métadonnées de photos du coin images, et pour la même raison : une promesse de nettoyage qui ne se relit pas n'est qu'une promesse.

Comment ça marche

  1. Déposez votre PDF. L'outil l'ouvre et dresse la liste de tout ce qu'il raconte : la fiche du document, le bloc XML, ce qui est posé sur les pages, et les dates.
  2. Lisez la fiche. Les lignes surlignées sont celles qui vous datent, vous nomment, ou nomment votre logiciel.
  3. Cliquez sur « Nettoyer et télécharger ». Le fichier propre arrive, et l'outil vous dit tout de suite ce qu'il a retiré, puis ce qui reste après relecture du fichier produit.

Formats acceptés

Uniquement des PDF. Pour les métadonnées d'une photo (date, appareil, position GPS), l'outil « Voir et nettoyer les métadonnées » du coin images fait le même travail sur les images.

Document PDF

Le contenu des pages n'est pas touché : ni le texte, ni les images, ni les polices, ni la mise en page. Seules les fiches d'identité du fichier sont retirées, et le document est ensuite RÉÉCRIT en entier pour qu'aucun octet d'avant ne subsiste à la fin du fichier.

Voir la matrice de compatibilité

Ses limites

Ce qui est ÉCRIT dans les pages reste écrit

Cet outil nettoie les fiches d'identité du fichier, pas son contenu. Un nom de famille tapé dans le texte, une adresse dans un en-tête, un tampon d'entreprise en image : tout cela reste, et c'est normal, c'est votre document. Effacer du texte dans un PDF est un autre geste, et un rectangle noir posé par-dessus ne l'efface pas : le texte reste sélectionnable dessous. C'est le piège le plus classique de la censure de documents.

80 Mo

Le document est ouvert entièrement en mémoire, et sa version réécrite vit à côté. C'est la limite honnête de ce qu'un onglet peut porter sans être tué par le système sur un appareil modeste.

Un PDF protégé par mot de passe ne s'ouvre pas ici

Il faut d'abord le déchiffrer, ce qui demande son mot de passe. L'outil « Protéger un PDF par mot de passe » du même coin sait le déverrouiller si vous l'avez.

L'identifiant du document est remis à une valeur commune, pas supprimé

La norme prévoit un identifiant de fichier dans la remorque, et beaucoup de lecteurs s'attendent à le trouver. Le supprimer rendrait le fichier plus fragile qu'utile. Il est donc remplacé par une valeur FIXE, identique pour tous les fichiers nettoyés ici : deux documents nettoyés par cet outil ne se distinguent plus l'un de l'autre par cet identifiant, alors que l'identifiant d'origine est une empreinte de votre session d'enregistrement.

Une signature électronique du document ne survit pas

Une signature scelle un fichier entier : réécrire le fichier, même pour le nettoyer, l'invalide. Aucun outil ne peut faire les deux, ni ici ni ailleurs. Gardez l'original signé de côté.

Questions sur cet outil

Mon document est-il envoyé quelque part ?

Non, et vous pouvez le vérifier en trente secondes. Ouvrez l'inspecteur de votre navigateur avec la touche F12, allez sur l'onglet « Réseau », videz la liste, puis déposez votre PDF et nettoyez-le. Aucune ligne n'apparaît. Coupez votre connexion et refaites-le : l'outil fonctionne exactement pareil.

Pourquoi trois endroits ? Ce n'est pas une seule fiche ?

Non, et c'est l'histoire du format. Le PDF a d'abord eu une fiche simple, dans la remorque du fichier : titre, auteur, logiciel, dates. Puis un second système est arrivé, en XML, plus riche, qui répète souvent les mêmes valeurs et ajoute parfois l'historique complet de vos enregistrements. Et certains logiciels de mise en page collent en plus leur propre bloc sur chaque page. Les trois coexistent dans le même fichier, et il faut nettoyer les trois.

Comment savoir que le nettoyage a vraiment marché ?

Parce que l'outil ROUVRE le fichier qu'il vient de fabriquer et vous dit ce qu'il y trouve. Trois fins sont possibles : plus rien, et il le dit ; il reste quelque chose, et il le NOMME au lieu de conclure ; ou la réécriture a échoué, et il le dit aussi. Vous pouvez refaire la vérification vous-même : déposez le fichier nettoyé dans cet outil, il devrait répondre qu'il est muet.

Est-ce que ça anonymise vraiment mon document ?

Ça retire ce que le FICHIER dit de vous, pas ce que le DOCUMENT dit de vous. Si votre nom est tapé dans le texte, il reste. Si votre signature est une image collée, elle reste. Si l'en-tête porte l'adresse de votre entreprise, elle reste. C'est votre document : un outil de métadonnées n'a pas à décider d'en effacer le contenu.

J'ai posé un rectangle noir sur une information sensible. Est-ce suffisant ?

Non, et c'est l'erreur la plus coûteuse du sujet. Un rectangle noir est un objet dessiné PAR-DESSUS le texte : le texte est toujours là, dans le fichier, sélectionnable et copiable. On peut le lire en quelques secondes. Pour retirer vraiment une information d'un PDF, il faut la supprimer du document d'origine et exporter à nouveau, ou transformer la page en image après avoir recouvert la zone d'un aplat opaque. Le coin images a un outil pour masquer une zone d'image de façon irréversible.

Le fichier nettoyé est-il plus léger ?

Un peu, et parfois beaucoup. Le bloc XML d'un document repris pendant des mois peut peser plusieurs kilooctets à lui seul, parce qu'il garde la trace de chaque enregistrement. La réécriture complète du fichier récupère aussi la place des objets devenus inutiles. Mais ce n'est pas un outil d'allègement : pour cela, c'est « Alléger un PDF », dans le même coin.