From b56638812255a69946e4bb713b03663e11caeded Mon Sep 17 00:00:00 2001 From: Benoit Blanchon Date: Sat, 7 Dec 2013 20:43:22 +0100 Subject: [PATCH] BaseSgmlLinkExtractor: Fixed the missing space when the link has an inner tag --- scrapy/contrib/linkextractors/sgml.py | 4 ++-- 1 file changed, 2 insertions(+), 2 deletions(-) diff --git a/scrapy/contrib/linkextractors/sgml.py b/scrapy/contrib/linkextractors/sgml.py index fb903dd57..72ebc743a 100644 --- a/scrapy/contrib/linkextractors/sgml.py +++ b/scrapy/contrib/linkextractors/sgml.py @@ -37,7 +37,7 @@ class BaseSgmlLinkExtractor(FixedSGMLParser): link.url = link.url.encode(response_encoding) link.url = urljoin(base_url, link.url) link.url = safe_url_string(link.url, response_encoding) - link.text = str_to_unicode(link.text, response_encoding, errors='replace') + link.text = str_to_unicode(link.text, response_encoding, errors='replace').strip() ret.append(link) return ret @@ -79,7 +79,7 @@ class BaseSgmlLinkExtractor(FixedSGMLParser): def handle_data(self, data): if self.current_link: - self.current_link.text = self.current_link.text + data.strip() + self.current_link.text = self.current_link.text + data def matches(self, url): """This extractor matches with any url, since