diff options
| -rw-r--r-- | newsdiff/core/parsers/haaretz.py | 2 | ||||
| -rw-r--r-- | newsdiff/core/tests/tests.py | 2 |
2 files changed, 2 insertions, 2 deletions
diff --git a/newsdiff/core/parsers/haaretz.py b/newsdiff/core/parsers/haaretz.py index c43379f..61e63c4 100644 --- a/newsdiff/core/parsers/haaretz.py +++ b/newsdiff/core/parsers/haaretz.py @@ -12,7 +12,7 @@ from ..utils import get_image_from_url class HaaretzParser(HtmlSoupParser): HOMEPAGE_URL = 'http://www.haaretz.co.il/' - ARTICLE_HREF_PATTERN = re.compile(r'(http:\/\/www\.haaretz\.co\.il)?/news/[a-zA-Z0-9\-\/]+/\d.\d+') + ARTICLE_HREF_PATTERN = re.compile(r'''^(http:\/\/www\.haaretz\.co\.il)?/((news|opinions|magazine|captain)/[a-zA-Z0-9\-\/]*(\.premium-)?)?\d\.\d+(#article_comments)?$''') ARTICLE_MODEL = HaaretzArticle IMAGE_MODEL = HaaretzImage diff --git a/newsdiff/core/tests/tests.py b/newsdiff/core/tests/tests.py index 35566e1..f108ed2 100644 --- a/newsdiff/core/tests/tests.py +++ b/newsdiff/core/tests/tests.py @@ -18,4 +18,4 @@ class HaaretzParsingTestCase(TestCase): def test_parse_homepage(self): soup = BeautifulSoup(self._get_content('haaretz.html')) articles = self.parser.parse_homepage(soup) - self.assertTrue(articles) + self.assertEqual(len(articles), 67) |
