_ Git - youtube-dl/blob - youtube_dl/extractor/tvp.py

   1 # -*- coding: utf-8 -*-
   2 from __future__ import unicode_literals
   3
   4 import re
   5
   6 from .common import InfoExtractor
   7
   8
   9 class TvpIE(InfoExtractor):
  10     IE_NAME = 'tvp.pl'
  11     _VALID_URL = r'https?://(?P<type>vod|www)\.tvp\.pl/.*/(?P<id>\d+)$'
  12
  13     _TESTS = [
  14         {
  15             'url': 'http://www.tvp.pl/warszawa/magazyny/campusnews/wideo/31102013/12878238',
  16             'info_dict': {
  17                 'id': '12878238',
  18                 'ext': 'wmv',
  19                 'title': 'CAMPUSnews, 31.10.2013 - Odcinek 2',
  20                 'description': '',
  21             },
  22             'skip': 'Download has to use same server IP as extraction. Therefore, a good (load-balancing) DNS resolver will make the download fail.',
  23         }, {
  24             'url': 'http://vod.tvp.pl/filmy-fabularne/filmy-za-darmo/ogniem-i-mieczem/wideo/odc-2/4278035',
  25             'info_dict': {
  26                 'id': '4278035',
  27                 'ext': 'wmv',
  28                 'title': 'Ogniem i mieczem, odc. 2',
  29                 'description': 'Bohun dowiaduje się o złamaniu przez kniahinię danego mu słowa i wyrusza do Rozłogów. Helenie w ostatniej chwili udaje się uciec dzięki pomocy Zagłoby.',
  30             },
  31             'skip': 'As above',
  32         }, {
  33             'url': 'http://vod.tvp.pl/seriale/obyczajowe/czas-honoru/sezon-1-1-13/i-seria-odc-13/194536',
  34             'info_dict': {
  35                 'id': '194536',
  36                 'ext': 'mp4',
  37                 'title': 'Czas honoru, I seria – odc. 13',
  38                 'description': 'WŁADEK\nCzesław prosi Marię o dostarczenie Władkowi zarazki tyfusu. Jeśli zachoruje zostanie przewieziony do szpitala skąd łatwiej będzie go odbić. Czy matka zdecyduje się zarazić syna? Karol odwiedza Wandę przyznaje się, że ją oszukiwał, ale ostrzega też, że grozi jej aresztowanie i nalega, żeby wyjechała z Warszawy. Czy dziewczyna zdecyduje się znów oddalić od ukochanego? Rozpoczyna się akcja odbicia Władka.',
  39             },
  40         }, {
  41             'url': 'http://www.tvp.pl/there-can-be-anything-so-i-shortened-it/17916176',
  42             'info_dict': {
  43                 'id': '17916176',
  44                 'ext': 'mp4',
  45                 'title': 'rozmaitosci, TVP Gorzów pokaże filmy studentów z podroży dookoła świata',
  46                 'description': '',
  47             },
  48             'params': {
  49                 # m3u8 download
  50                 'skip_download': 'true',
  51             },
  52         }, {
  53             'url': 'http://vod.tvp.pl/seriale/obyczajowe/na-sygnale/sezon-2-27-/odc-39/17834272',
  54             'info_dict': {
  55                 'id': '17834272',
  56                 'ext': 'mp4',
  57                 'title': 'Na sygnale, odc. 39',
  58                 'description': 'Ekipa Wiktora ratuje młodą matkę, która spadła ze schodów trzymając na rękach noworodka. Okazuje się, że dziewczyna jest surogatką, a biologiczni rodzice dziecka próbują zmusić ją do oddania synka…',
  59             },
  60             'params': {
  61                 # m3u8 download
  62                 'skip_download': 'true',
  63             },
  64         },
  65     ]
  66
  67     def _real_extract(self, url):
  68         mobj = re.match(self._VALID_URL, url)
  69         video_id = mobj.group('id')
  70         webpage = self._download_webpage(
  71             'http://www.tvp.pl/sess/tvplayer.php?object_id=%s' % video_id, video_id)
  72         title = self._og_search_title(webpage)
  73         series = self._search_regex(
  74             r'{name:\s*([\'"])SeriesTitle\1,\s*value:\s*\1(?P<series>.*?)\1},',
  75             webpage, 'series', group='series', default=None)
  76         if series is not None and series not in title:
  77             title = '%s, %s' % (series, title)
  78         info_dict = {
  79             'id': video_id,
  80             'title': title,
  81             'thumbnail': self._og_search_thumbnail(webpage),
  82             'description': self._og_search_description(webpage),
  83         }
  84         video_url = self._search_regex(
  85             r'0:{src:([\'"])(?P<url>.*?)\1', webpage, 'formats', group='url', default=None)
  86         if video_url is None:
  87             video_url = self._download_json(
  88                 'http://www.tvp.pl/pub/stat/videofileinfo?video_id=%s' % video_id,
  89                 video_id)['video_url']
  90
  91         ext = video_url.rsplit('.', 1)[-1]
  92         if ext != 'ism/manifest':
  93             if '/' in ext:
  94                 ext = 'mp4'
  95             info_dict.update({
  96                 'ext': ext,
  97                 'url': video_url,
  98             })
  99         else:
 100             m3u8_url = re.sub('([^/]*)\.ism/manifest', r'\1.ism/\1.m3u8', video_url)
 101             formats = self._extract_m3u8_formats(m3u8_url, video_id, 'mp4')
 102             info_dict.update({
 103                 'formats': formats,
 104             })
 105         return info_dict
 106
 107
 108 class TvpSeriesIE(InfoExtractor):
 109     IE_NAME = 'tvp.pl:Series'
 110     _VALID_URL = r'https?://vod\.tvp\.pl/(?:[^/]+/){2}(?P<id>[^/]+)/?$'
 111
 112     _TESTS = [
 113         {
 114             'url': 'http://vod.tvp.pl/filmy-fabularne/filmy-za-darmo/ogniem-i-mieczem',
 115             'info_dict': {
 116                 'title': 'Ogniem i mieczem',
 117                 'id': '4278026',
 118             },
 119             'playlist_count': 4,
 120         }, {
 121             'url': 'http://vod.tvp.pl/audycje/podroze/boso-przez-swiat',
 122             'info_dict': {
 123                 'title': 'Boso przez świat',
 124                 'id': '9329207',
 125             },
 126             'playlist_count': 86,
 127         }
 128     ]
 129
 130     def _force_download_webpage(self, url, v_id, tries=0):
 131         if tries >= 5:
 132             raise ExtractorError(
 133                 '%s: Cannot download webpage, try again later' % v_id)
 134         # Sometimes happen, but in my tests second try always succeeded
 135         try:
 136             return self._download_webpage(url, v_id)
 137         except IncompleteRead as e:
 138             return self._force_download_webpage(url, v_id, tries+1)
 139
 140     def _real_extract(self, url):
 141         display_id = self._match_id(url)
 142         webpage = self._force_download_webpage(url, display_id)
 143         title = self._html_search_regex(
 144             r'(?s) id=[\'"]path[\'"]>(.*?)</span>', webpage, 'series')
 145         title = title.split(' / ', 2)[-1]
 146         playlist_id = self._search_regex(r'nodeId:\s*(\d+)', webpage, 'playlist id')
 147         playlist = self._force_download_webpage(
 148             'http://vod.tvp.pl/vod/seriesAjax?type=series&nodeId=%s&recommend'
 149             'edId=0&sort=&page=0&pageSize=1000000' % playlist_id, display_id)
 150         videos_paths = re.findall(
 151             '(?s)class="shortTitle">.*?href="(/[^"]+)', playlist)
 152         entries = [
 153             self.url_result('http://vod.tvp.pl%s' % v_path, ie=TvpIE.ie_key())
 154             for v_path in videos_paths]
 155         return {
 156             '_type': 'playlist',
 157             'id': playlist_id,
 158             'display_id': display_id,
 159             'title': title,
 160             'entries': entries,
 161         }