Limpador de texto colado

Os dados são processados apenas neste navegador. Consulte a política de privacidade.

Como usar

  1. Copie texto de uma página, do Word, do Google Docs, de um e-mail ou do Notion e cole na caixa Colar. A formatação (HTML) é lida como está, então não é preciso colar como texto simples antes.
  2. Confira o resultado limpo na aba Ler. Anúncios, menus, estilos e restos do Word somem; ficam títulos, listas, tabelas, links e ênfase.
  3. Escolha o formato de que precisa (Markdown, HTML ou Texto) e clique em Copiar ou baixe o arquivo. Copiar com formatação, na aba Ler, cola em e-mails e documentos como texto formatado limpo.
  4. Desligue as Opções de limpeza de links, imagens ou tabelas para tirá-los; o resultado muda na hora. Para editar o HTML colado, use a aba Código HTML.

Exemplos

Marcadores do Word viram uma lista de verdade

Um parágrafo com marcador copiado do Word é, no HTML, um parágrafo comum que começa com um caractere «·» e vários espaços não separáveis. O limpador lê o nível de recuo (mso-list level), reconstrói uma lista aninhada e remove o caractere do marcador.

Links com parâmetros de rastreamento

Links copiados de newsletters e redes sociais costumam trazer parâmetros como utm_source. Por padrão só os de rastreamento são removidos; os que escolhem a página, como id, ficam.

Entrada
https://example.com/post?id=7&utm_source=newsletter&fbclid=IwAR0
Resultado
https://example.com/post?id=7

O problema do «tudo em negrito» do Google Docs

O HTML copiado do Google Docs envolve o documento inteiro numa tag b com font-weight:normal, e por isso conversores simples deixam tudo em negrito. O limpador tira esse invólucro e deixa em negrito só o texto que realmente tem font-weight:700.

Detalhes

Quando você copia texto formatado, a área de transferência guarda HTML além dos caracteres que você vê. De uma página vêm espaços de anúncio, botões de compartilhar e links de rastreamento; do Word, estilos que começam com mso-, spans vazios e sequências de  ; do Google Docs, um atributo style enorme em cada trecho de texto. Esta ferramenta lê esse HTML dentro do navegador e mantém apenas a estrutura que é conteúdo: títulos, parágrafos, listas, tabelas, links, ênfase e código.

A limpeza reconstrói o que é permitido em vez de procurar o que apagar. O HTML colado nunca é inserido na página: para a prévia são criados do zero apenas os elementos da lista permitida (p, h1–h6, listas, tabelas, a, strong, em, code, pre, blockquote, br, hr). Scripts, estilos, iframes e atributos de evento nunca passam; links mantêm só endereços http, https e mailto, e imagens só http e https. As imagens não são carregadas, só o endereço aparece, então os pixels de rastreamento de e-mails não disparam.

Parágrafos com marcadores do Word viram listas de verdade, e o negrito ou itálico que o Google Docs expressa com estilos vira strong e em. Tabelas de layout, comuns em newsletters por e-mail, são desfeitas em conteúdo, enquanto tabelas de dados reais viram tabelas Markdown no estilo do GitHub. Células mescladas (colspan, rowspan) são preenchidas com células vazias porque tabelas Markdown não mesclam células.

Anúncios e menus são detectados por elementos como nav, aside e footer e por nomes de classe como ad, share ou related. Um bloco cujo nome parece de anúncio mas que tem mais de 600 caracteres de texto pode ser o próprio artigo, então é mantido. Se algo que você precisa sumiu, desligue Remover anúncios e menus.

Perguntas frequentes

O conteúdo colado é enviado a algum servidor?

Não. A leitura, a limpeza e a conversão acontecem no navegador e a entrada não é salva em lugar nenhum. Ao fechar ou recarregar a página, ela some.

Colei, mas entrou como texto simples sem formatação.

O aplicativo de origem não colocou HTML na área de transferência; alguns aplicativos e navegadores móveis fazem isso. Se você tiver o HTML original, cole-o na aba Código HTML. O texto simples também é organizado: linhas em branco viram parágrafos e quebras simples continuam como quebras.

Por que as imagens não aparecem?

As imagens nunca são carregadas; só o endereço é mantido. Abrir uma imagem remota avisa aquele servidor de que você a viu e dispararia os pixels de rastreamento de e-mails. O Markdown e o HTML resultantes mantêm o endereço, então as imagens aparecem onde você colar o resultado. Dados de imagem embutidos (endereços data:) não são incluídos.

Qual variante de Markdown é gerada?

CommonMark com tabelas do GitHub (GFM). Quebras de linha dentro de um parágrafo usam dois espaços no fim e blocos de código usam cercas de crases. Caracteres como * e _ só são escapados quando abririam ênfase ou código, então palavras como snake_case continuam legíveis.

O que a remoção de parâmetros de rastreamento apaga?

Só parâmetros que começam com utm_ e rastreadores de anúncios ou e-mail como fbclid, gclid, msclkid e mc_cid. Parâmetros que escolhem a página, como id ou page, ficam. Links de redirecionamento do Google Docs, do Outlook e do Facebook voltam ao endereço original.

O que é Copiar com formatação?

Copia o resultado limpo como HTML e como texto simples ao mesmo tempo. Colando no Gmail, no Google Docs ou no Notion você tem texto formatado limpo com títulos, listas e links; num editor simples, tem texto.