Einfüge-Reiniger

Eingaben werden nur in diesem Browser verarbeitet. Siehe Datenschutzerklärung.

Anwendung

  1. Text aus einer Webseite, Word, Google Docs, einer E-Mail oder Notion kopieren und in das Feld Einfügen einfügen. Die Formatierung (HTML) wird direkt gelesen – vorher als reinen Text einfügen ist nicht nötig.
  2. Das bereinigte Ergebnis im Tab Lesen prüfen. Werbung, Menüs, Inline-Stile und Word-Reste verschwinden; Überschriften, Listen, Tabellen, Links und Hervorhebungen bleiben.
  3. Das benötigte Format wählen (Markdown, HTML oder Text) und Kopieren oder als Datei herunterladen. Formatiert kopieren im Tab Lesen fügt sich in E-Mails und Dokumente als sauberer formatierter Text ein.
  4. Unter Bereinigungsoptionen Links, Bilder oder Tabellen abschalten, wenn sie wegsollen; das Ergebnis ändert sich sofort. Das eingefügte HTML selbst lässt sich im Tab HTML-Quelltext bearbeiten.

Beispiele

Word-Aufzählungen werden zu echten Listen

Ein aus Word kopierter Aufzählungsabsatz ist im HTML ein gewöhnlicher Absatz, der mit einem «·» und mehreren geschützten Leerzeichen beginnt. Der Reiniger liest die Einzugsebene (mso-list level), baut eine verschachtelte Liste und entfernt das Aufzählungszeichen.

Links mit Tracking-Parametern

Aus Newslettern und sozialen Netzwerken kopierte Links tragen oft Parameter wie utm_source. Standardmäßig werden nur Tracking-Parameter entfernt; Parameter, die die Seite bestimmen, etwa id, bleiben.

Eingabe
https://example.com/post?id=7&utm_source=newsletter&fbclid=IwAR0
Ergebnis
https://example.com/post?id=7

Das Google-Docs-Problem «alles fett»

Aus Google Docs kopiertes HTML umschließt das ganze Dokument mit einem b-Tag mit font-weight:normal, deshalb machen einfache Konverter alles fett. Der Reiniger entfernt diese Hülle und lässt nur Text fett, der wirklich font-weight:700 hat.

Details

Beim Kopieren von formatiertem Text landet neben den sichtbaren Zeichen auch HTML in der Zwischenablage. Von einer Webseite kommen Werbeflächen, Teilen-Schaltflächen und Tracking-Links mit; aus Word Stile, die mit mso- beginnen, leere span-Elemente und Ketten von  ; aus Google Docs ein langes style-Attribut an jedem Textstück. Dieses Werkzeug liest das HTML im Browser und behält nur die Struktur, die Inhalt ist: Überschriften, Absätze, Listen, Tabellen, Links, Hervorhebungen und Code.

Die Bereinigung baut das Erlaubte neu auf, statt nach Zu-Löschendem zu suchen. Das eingefügte HTML wird nie in die Seite eingesetzt: Für die Vorschau werden nur Elemente aus der Positivliste (p, h1–h6, Listen, Tabellen, a, strong, em, code, pre, blockquote, br, hr) neu erzeugt. Skripte, Stile, iframes und Ereignis-Attribute kommen nie durch; Links behalten nur http-, https- und mailto-Adressen, Bilder nur http- und https-Adressen. Bilder werden nicht geladen, nur ihre Adresse wird gezeigt – Tracking-Pixel in E-Mails lösen also nicht aus.

Word-Aufzählungsabsätze werden zu echten Listen, und Fett oder Kursiv, das Google Docs über Stile ausdrückt, wird zu strong und em. Layout-Tabellen, wie sie in E-Mail-Newslettern üblich sind, werden in ihren Inhalt aufgelöst, echte Datentabellen werden zu Markdown-Tabellen im GitHub-Stil. Verbundene Zellen (colspan, rowspan) werden mit leeren Zellen aufgefüllt, weil Markdown-Tabellen keine Zellverbindung kennen.

Werbung und Menüs werden an Elementen wie nav, aside und footer sowie an Klassennamen wie ad, share oder related erkannt. Ein Block, dessen Name nach Werbung aussieht, der aber mehr als 600 Zeichen Text enthält, kann der Artikel selbst sein und bleibt deshalb erhalten. Wenn etwas Benötigtes fehlt, Werbung und Menüs entfernen ausschalten.

Häufige Fragen

Wird der eingefügte Inhalt an einen Server gesendet?

Nein. Lesen, Bereinigen und Umwandeln geschehen im Browser, und die Eingabe wird nirgends gespeichert. Nach Schließen oder Neuladen der Seite ist sie weg.

Ich habe eingefügt, aber es kam als reiner Text ohne Formatierung an.

Die Quell-App hat kein HTML in die Zwischenablage gelegt; manche Apps und mobilen Browser tun das. Wenn das Original-HTML vorliegt, im Tab HTML-Quelltext einfügen. Reiner Text wird trotzdem geordnet: Leerzeilen trennen Absätze, einfache Umbrüche bleiben Umbrüche.

Warum werden keine Bilder angezeigt?

Bilder werden nie geladen, nur ihre Adresse bleibt erhalten. Das Öffnen eines entfernten Bildes verrät dem Server, dass man es angesehen hat, und würde Tracking-Pixel in E-Mails auslösen. Markdown- und HTML-Ausgabe enthalten die Adresse weiterhin, sodass Bilder dort erscheinen, wo man das Ergebnis einfügt. Eingebettete Bilddaten (data:-Adressen) werden nicht übernommen.

Welche Markdown-Variante wird erzeugt?

CommonMark mit GitHub-Tabellen (GFM). Zeilenumbrüche innerhalb eines Absatzes nutzen zwei Leerzeichen am Zeilenende, Codeblöcke Backtick-Zäune. Zeichen wie * und _ werden nur maskiert, wo sie Hervorhebung oder Code einleiten würden – Wörter wie snake_case bleiben lesbar.

Was entfernt die Tracking-Bereinigung?

Nur Parameter, die mit utm_ beginnen, sowie Werbe- und E-Mail-Tracker wie fbclid, gclid, msclkid und mc_cid. Parameter, die die Seite bestimmen, etwa id oder page, bleiben. Weiterleitungslinks von Google Docs, Outlook und Facebook werden zur Originaladresse aufgelöst.

Was bedeutet Formatiert kopieren?

Das bereinigte Ergebnis wird gleichzeitig als HTML und als reiner Text kopiert. In Gmail, Google Docs oder Notion eingefügt ergibt das sauber formatierten Text mit Überschriften, Listen und Links, in einem einfachen Editor reinen Text.