diff options
| author | Yuval Adam <yuv.adm@gmail.com> | 2013-12-24 14:06:55 +0200 |
|---|---|---|
| committer | Yuval Adam <yuv.adm@gmail.com> | 2013-12-24 14:06:55 +0200 |
| commit | 5ccdd1f66dc5a4aa4cd54f70bea5d70bfa6b571d (patch) | |
| tree | 2d80866eff185fdf4f1326c11d28a7713df06130 | |
| parent | 540b820f210e2e20b6476988d8e967a50a82226d (diff) | |
Fix article regex
| -rw-r--r-- | newsdiff/core/parsers/haaretz.py | 2 | ||||
| -rw-r--r-- | newsdiff/core/tests/tests.py | 2 |
2 files changed, 2 insertions, 2 deletions
diff --git a/newsdiff/core/parsers/haaretz.py b/newsdiff/core/parsers/haaretz.py index c43379f..61e63c4 100644 --- a/newsdiff/core/parsers/haaretz.py +++ b/newsdiff/core/parsers/haaretz.py @@ -12,7 +12,7 @@ from ..utils import get_image_from_url class HaaretzParser(HtmlSoupParser): HOMEPAGE_URL = 'http://www.haaretz.co.il/' - ARTICLE_HREF_PATTERN = re.compile(r'(http:\/\/www\.haaretz\.co\.il)?/news/[a-zA-Z0-9\-\/]+/\d.\d+') + ARTICLE_HREF_PATTERN = re.compile(r'''^(http:\/\/www\.haaretz\.co\.il)?/((news|opinions|magazine|captain)/[a-zA-Z0-9\-\/]*(\.premium-)?)?\d\.\d+(#article_comments)?$''') ARTICLE_MODEL = HaaretzArticle IMAGE_MODEL = HaaretzImage diff --git a/newsdiff/core/tests/tests.py b/newsdiff/core/tests/tests.py index 35566e1..f108ed2 100644 --- a/newsdiff/core/tests/tests.py +++ b/newsdiff/core/tests/tests.py @@ -18,4 +18,4 @@ class HaaretzParsingTestCase(TestCase): def test_parse_homepage(self): soup = BeautifulSoup(self._get_content('haaretz.html')) articles = self.parser.parse_homepage(soup) - self.assertTrue(articles) + self.assertEqual(len(articles), 67) |
