From cad99401df0aa0019fa706e38395ad7918a4a1ae Mon Sep 17 00:00:00 2001 From: Kuchen Date: Fri, 28 Jun 2024 11:31:25 +0200 Subject: [PATCH] added support for even more websites that have html between them --- KC-Scraper.py | 11 ++++++++++- 1 file changed, 10 insertions(+), 1 deletion(-) diff --git a/KC-Scraper.py b/KC-Scraper.py index 354a424..21da591 100644 --- a/KC-Scraper.py +++ b/KC-Scraper.py @@ -111,6 +111,15 @@ class KCScraper: self.goodSites.add(site) else: self.goodSites.add(site) + + # Replace opening HTML tags with ':' + r = re.sub(r'<[^/][^>]*>', ':', r) + # Remove closing HTML tags + r = re.sub(r']*>', '', r) + + while r.count("::") > 0: + r = r.replace("::", ":") + locProxies = re.findall(r"\b\d{1,3}\.\d{1,3}\.\d{1,3}\.\d{1,3}" + self.proxyDelimiter + r"\d{1,5}\b", KCScraper.replaceAll(self, r)) @@ -328,4 +337,4 @@ class KCScraper: if __name__ == "__main__": - KCScraper().main() + KCScraper().main() \ No newline at end of file