diff --git a/core/medium_parser/utils.py b/core/medium_parser/utils.py index c3d4116..85b96fd 100644 --- a/core/medium_parser/utils.py +++ b/core/medium_parser/utils.py @@ -18,7 +18,7 @@ from bs4 import BeautifulSoup VALID_ID_CHARS = set(string.ascii_letters + string.digits) KNOWN_MEDIUM_NETLOC = ("javascript.plainenglish.io", "python.plainenglish.io", "levelup.gitconnected.com") -KNOWN_MEDIUM_DOMAINS = ("medium.com", "towardsdatascience.com", "eand.co", "betterprogramming.pub", "curiouse.co", "betterhumans.pub", "uxdesign.cc") +KNOWN_MEDIUM_DOMAINS = ("medium.com", "towardsdatascience.com", "itnext.io", "eand.co", "betterprogramming.pub", "curiouse.co", "betterhumans.pub", "uxdesign.cc") NOT_MEDIUM_DOMAINS = ("github.com", "yandex.ru", "yandex.kz", "youtube.com", "nytimes.com", "wsj.com", "reddit.com", "elpais.com", "forbes.com", "bloomberg.com") diff --git a/test.py b/test.py index 96694df..7da53e2 100644 --- a/test.py +++ b/test.py @@ -17,6 +17,7 @@ url_for_test = { "https://anudeep-vysyaraju.medium.com/how-any-gitamite-can-get-free-linkedin-premium-membership-d4222bd1a0b3" # <--- Check for non properly aligned emojies } +blacklist_url = {"51e23c5a2aac"} def main(): for url in url_for_test: