Descrição
Extrai texto legível de artigos a partir de HTML usando parsing baseado em lxml. Ajuda crawlers, arquivadores, leitores e ferramentas de processamento de texto a separar conteúdo principal de navegação, anúncios e elementos repetitivos da página.
Conteúdo web extraído pode ser protegido por copyright ou privado atrás de controles de acesso. Respeite termos do site e revise o texto antes de republicá-lo.