Nettoyeur de texte collé
Les données sont traitées uniquement dans ce navigateur. Voir la politique de confidentialité.
Mode d’emploi
- Copiez du texte depuis une page web, Word, Google Docs, un e-mail ou Notion et collez-le dans la zone Coller. La mise en forme (HTML) est lue telle quelle : inutile de le coller d’abord en texte brut.
- Vérifiez le résultat nettoyé dans l’onglet Lire. Pubs, menus, styles et restes de Word disparaissent ; titres, listes, tableaux, liens et emphase restent.
- Choisissez le format voulu (Markdown, HTML ou Texte) puis Copier ou téléchargez le fichier. Copier avec la mise en forme, dans l’onglet Lire, se colle dans un e-mail ou un document en texte enrichi propre.
- Désactivez les Options de nettoyage des liens, images ou tableaux pour les retirer ; le résultat change aussitôt. Pour modifier le HTML collé, utilisez l’onglet Code HTML.
Exemples
Les puces Word deviennent une vraie liste
Un paragraphe à puce copié depuis Word est, en HTML, un paragraphe ordinaire qui commence par un caractère « · » et plusieurs espaces insécables. Le nettoyeur lit le niveau de retrait (mso-list level), reconstruit une liste imbriquée et retire le caractère de puce.
Liens avec paramètres de suivi
Les liens copiés depuis des newsletters ou des réseaux sociaux portent souvent des paramètres comme utm_source. Par défaut, seuls les paramètres de suivi sont retirés ; ceux qui choisissent la page, comme id, sont conservés.
- Entrée
https://example.com/post?id=7&utm_source=newsletter&fbclid=IwAR0
- Résultat
https://example.com/post?id=7
Le problème « tout en gras » de Google Docs
Le HTML copié depuis Google Docs enveloppe tout le document dans une balise b avec font-weight:normal, si bien que les convertisseurs simples mettent tout en gras. Le nettoyeur retire cette enveloppe et ne garde en gras que le texte qui a vraiment font-weight:700.
Détails
Quand vous copiez du texte mis en forme, le presse-papiers contient du HTML en plus des caractères visibles. Depuis une page web arrivent des emplacements publicitaires, des boutons de partage et des liens de suivi ; depuis Word, des styles commençant par mso-, des span vides et des suites de ; depuis Google Docs, un très long attribut style sur chaque morceau de texte. Cet outil lit ce HTML dans votre navigateur et ne garde que la structure qui relève du contenu : titres, paragraphes, listes, tableaux, liens, emphase et code.
Le nettoyage reconstruit ce qui est autorisé au lieu de chercher ce qu’il faut supprimer. Le HTML collé n’est jamais inséré dans la page : pour l’aperçu, seuls les éléments de la liste autorisée (p, h1–h6, listes, tableaux, a, strong, em, code, pre, blockquote, br, hr) sont recréés. Scripts, styles, iframes et attributs d’événement ne passent jamais ; les liens ne gardent que les adresses http, https et mailto, les images que http et https. Les images ne sont pas chargées, seule leur adresse s’affiche, donc les pixels de suivi des e-mails ne se déclenchent pas.
Les paragraphes à puces de Word deviennent de vraies listes, et le gras ou l’italique que Google Docs exprime par des styles devient strong et em. Les tableaux de mise en page, fréquents dans les newsletters, sont dépliés en contenu, tandis que les vrais tableaux de données deviennent des tableaux Markdown façon GitHub. Les cellules fusionnées (colspan, rowspan) sont complétées par des cellules vides, car les tableaux Markdown ne savent pas fusionner.
Les pubs et menus sont repérés grâce aux éléments nav, aside et footer et à des noms de classe comme ad, share ou related. Un bloc dont le nom ressemble à une pub mais qui contient plus de 600 caractères de texte peut être l’article lui-même : il est donc conservé. Si quelque chose d’utile a disparu, désactivez Retirer pubs et menus.
Questions fréquentes
Le contenu collé est-il envoyé à un serveur ?
Non. La lecture, le nettoyage et la conversion se font dans votre navigateur et la saisie n’est enregistrée nulle part. Fermez ou rechargez la page et elle disparaît.
J’ai collé, mais le texte arrive sans mise en forme.
L’application d’origine n’a pas mis de HTML dans le presse-papiers ; certaines applications et navigateurs mobiles font ainsi. Si vous avez le HTML d’origine, collez-le dans l’onglet Code HTML. Le texte brut est tout de même rangé : les lignes vides séparent les paragraphes et les sauts simples restent des sauts.
Pourquoi les images ne s’affichent-elles pas ?
Les images ne sont jamais chargées ; seule leur adresse est gardée. Ouvrir une image distante indique au serveur que vous l’avez vue et déclencherait les pixels de suivi des e-mails. Le Markdown et le HTML produits contiennent toujours l’adresse : les images apparaissent là où vous collez le résultat. Les données d’image intégrées (adresses data:) ne sont pas reprises.
Quelle variante de Markdown est produite ?
CommonMark avec les tableaux GitHub (GFM). Les sauts de ligne dans un paragraphe utilisent deux espaces en fin de ligne et les blocs de code des clôtures d’accents graves. Les caractères comme * et _ ne sont échappés que s’ils ouvriraient une emphase ou du code, donc des mots comme snake_case restent lisibles.
Que supprime le retrait des paramètres de suivi ?
Seulement les paramètres commençant par utm_ et les traceurs publicitaires ou d’e-mail comme fbclid, gclid, msclkid et mc_cid. Les paramètres qui choisissent la page, comme id ou page, restent. Les liens de redirection de Google Docs, d’Outlook et de Facebook retrouvent leur adresse d’origine.
Que fait Copier avec la mise en forme ?
Le résultat nettoyé est copié à la fois en HTML et en texte brut. Collé dans Gmail, Google Docs ou Notion, il donne un texte enrichi propre avec titres, listes et liens ; dans un éditeur simple, du texte.