From 83fff6c9511fdde1024d8cd33d99314ddf4eb2ef Mon Sep 17 00:00:00 2001 From: =?UTF-8?q?Mikael=20Schir=C3=A9n?= Date: Thu, 28 Sep 2023 23:50:14 +0200 Subject: [PATCH 1/2] Add dotx to exclude for documents --- scrapy/linkextractors/__init__.py | 1 + 1 file changed, 1 insertion(+) diff --git a/scrapy/linkextractors/__init__.py b/scrapy/linkextractors/__init__.py index 906188184..492c455fd 100644 --- a/scrapy/linkextractors/__init__.py +++ b/scrapy/linkextractors/__init__.py @@ -73,6 +73,7 @@ IGNORED_EXTENSIONS = [ "pps", "doc", "docx", + "dotx", "odt", "ods", "odg", From da6e75d00a8a64fea0073816d59eef2ae3b4c672 Mon Sep 17 00:00:00 2001 From: =?UTF-8?q?Mikael=20Schir=C3=A9n?= Date: Fri, 29 Sep 2023 09:44:04 +0200 Subject: [PATCH 2/2] Added more common MS Office file extensions --- scrapy/linkextractors/__init__.py | 9 +++++++++ 1 file changed, 9 insertions(+) diff --git a/scrapy/linkextractors/__init__.py b/scrapy/linkextractors/__init__.py index 492c455fd..6b8be909e 100644 --- a/scrapy/linkextractors/__init__.py +++ b/scrapy/linkextractors/__init__.py @@ -67,12 +67,21 @@ IGNORED_EXTENSIONS = [ "webm", # office suites "xls", + "xlsm", "xlsx", + "xltm", + "xltx", + "potm", + "potx", "ppt", + "pptm", "pptx", "pps", "doc", + "docb", + "docm", "docx", + "dotm", "dotx", "odt", "ods",