[tvp] Add extractor
[youtube-dl] / youtube_dl / extractor / tvp.py
1 # -*- coding: utf-8 -*-
2 from __future__ import unicode_literals
3
4 import re
5
6 from .common import InfoExtractor
7
8
9 class TvpIE(InfoExtractor):
10     IE_NAME = 'tvp.pl'
11     _VALID_URL = r'https?://(?P<type>vod|www)\.tvp\.pl/.*/(?P<id>\d+)$'
12
13     _TESTS = [
14         {
15             'url': 'http://www.tvp.pl/warszawa/magazyny/campusnews/wideo/31102013/12878238',
16             'info_dict': {
17                 'id': '12878238',
18                 'ext': 'wmv',
19                 'title': 'CAMPUSnews, 31.10.2013 - Odcinek 2',
20                 'description': '',
21             },
22             'skip': 'Download has to use same server IP as extraction. Therefore, a good (load-balancing) DNS resolver will make the download fail.',
23         }, {
24             'url': 'http://vod.tvp.pl/filmy-fabularne/filmy-za-darmo/ogniem-i-mieczem/wideo/odc-2/4278035',
25             'info_dict': {
26                 'id': '4278035',
27                 'ext': 'wmv',
28                 'title': 'Ogniem i mieczem, odc. 2',
29                 'description': 'Bohun dowiaduje się o złamaniu przez kniahinię danego mu słowa i wyrusza do Rozłogów. Helenie w ostatniej chwili udaje się uciec dzięki pomocy Zagłoby.',
30             },
31             'skip': 'As above',
32         }, {
33             'url': 'http://vod.tvp.pl/seriale/obyczajowe/czas-honoru/sezon-1-1-13/i-seria-odc-13/194536',
34             'info_dict': {
35                 'id': '194536',
36                 'ext': 'mp4',
37                 'title': 'Czas honoru, I seria – odc. 13',
38                 'description': 'WŁADEK\nCzesław prosi Marię o dostarczenie Władkowi zarazki tyfusu. Jeśli zachoruje zostanie przewieziony do szpitala skąd łatwiej będzie go odbić. Czy matka zdecyduje się zarazić syna? Karol odwiedza Wandę przyznaje się, że ją oszukiwał, ale ostrzega też, że grozi jej aresztowanie i nalega, żeby wyjechała z Warszawy. Czy dziewczyna zdecyduje się znów oddalić od ukochanego? Rozpoczyna się akcja odbicia Władka.',
39             },
40         }, {
41             'url': 'http://www.tvp.pl/there-can-be-anything-so-i-shortened-it/17916176',
42             'info_dict': {
43                 'id': '17916176',
44                 'ext': 'mp4',
45                 'title': 'rozmaitosci, TVP Gorzów pokaże filmy studentów z podroży dookoła świata',
46                 'description': '',
47             },
48             'params': {
49                 # m3u8 download
50                 'skip_download': 'true',
51             },
52         }, {
53             'url': 'http://vod.tvp.pl/seriale/obyczajowe/na-sygnale/sezon-2-27-/odc-39/17834272',
54             'info_dict': {
55                 'id': '17834272',
56                 'ext': 'mp4',
57                 'title': 'Na sygnale, odc. 39',
58                 'description': 'Ekipa Wiktora ratuje młodą matkę, która spadła ze schodów trzymając na rękach noworodka. Okazuje się, że dziewczyna jest surogatką, a biologiczni rodzice dziecka próbują zmusić ją do oddania synka…',
59             },
60             'params': {
61                 # m3u8 download
62                 'skip_download': 'true',
63             },
64         },
65     ]
66
67     def _real_extract(self, url):
68         mobj = re.match(self._VALID_URL, url)
69         video_id = mobj.group('id')
70         webpage = self._download_webpage(
71             'http://www.tvp.pl/sess/tvplayer.php?object_id=%s' % video_id, video_id)
72         title = self._og_search_title(webpage)
73         series = self._search_regex(
74             r'{name:\s*([\'"])SeriesTitle\1,\s*value:\s*\1(?P<series>.*?)\1},',
75             webpage, 'series', group='series', default=None)
76         if series is not None and series not in title:
77             title = '%s, %s' % (series, title)
78         info_dict = {
79             'id': video_id,
80             'title': title,
81             'thumbnail': self._og_search_thumbnail(webpage),
82             'description': self._og_search_description(webpage, default=''),
83         }
84         if mobj.group('type') == 'vod' and info_dict['description'] == '':
85             info_dict.update({
86                 'description': self._html_search_regex(
87                     r'(?s)<div\s+class=[\'"]opis.*?</div>',
88                     self._download_webpage(url, video_id), 'description', group=0),
89             })
90
91         video_url = self._search_regex(
92             r'0:{src:([\'"])(?P<url>.*?)\1', webpage, 'formats', group='url', default=None)
93         if video_url is None:
94             video_url = self._download_json(
95                 'http://www.tvp.pl/pub/stat/videofileinfo?video_id=%s' % video_id,
96                 video_id)['video_url']
97
98         ext = video_url.rsplit('.', 1)[-1]
99         if ext != 'ism/manifest':
100             if '/' in ext:
101                 ext = 'mp4'
102             info_dict.update({
103                 'ext': ext,
104                 'url': video_url,
105             })
106         else:
107             m3u8_url = re.sub('([^/]*)\.ism/manifest', r'\1.ism/\1.m3u8', video_url)
108             formats = self._extract_m3u8_formats(m3u8_url, video_id, 'mp4')
109             info_dict.update({
110                 'formats': formats,
111             })
112         return info_dict
113
114
115 class TvpSeriesIE(InfoExtractor):
116     IE_NAME = 'tvp.pl:Series'
117     _VALID_URL = r'https?://vod\.tvp\.pl/(?:[^/]+/){2}(?P<id>[^/]+)/?$'
118
119     _TESTS = [
120         {
121             'url': 'http://vod.tvp.pl/filmy-fabularne/filmy-za-darmo/ogniem-i-mieczem',
122             'info_dict': {
123                 'title': 'Ogniem i mieczem',
124                 'id': '4278026',
125             },
126             'playlist_count': 4,
127         }, {
128             'url': 'http://vod.tvp.pl/audycje/podroze/boso-przez-swiat',
129             'info_dict': {
130                 'title': 'Boso przez świat',
131                 'id': '9329207',
132             },
133             'playlist_count': 86,
134         }
135     ]
136
137     def _force_download_webpage(self, url, v_id, tries=0):
138         if tries >= 5:
139             raise ExtractorError(
140                 '%s: Cannot download webpage, try again later' % v_id)
141         # Sometimes happen, but in my tests second try always succeeded
142         try:
143             return self._download_webpage(url, v_id)
144         except IncompleteRead as e:
145             return self._force_download_webpage(url, v_id, tries+1)
146     
147     def _real_extract(self, url):
148         display_id = self._match_id(url)
149         webpage = self._force_download_webpage(url, display_id)
150         title = self._html_search_regex(
151             r'(?s) id=[\'"]path[\'"]>(.*?)</span>', webpage, 'series')
152         title = title.split(' / ', 2)[-1]
153         playlist_id = self._search_regex(r'nodeId:\s*(\d+)', webpage, 'playlist id')
154         playlist = self._force_download_webpage(
155             'http://vod.tvp.pl/vod/seriesAjax?type=series&nodeId=%s&recommend'
156             'edId=0&sort=&page=0&pageSize=1000000' % playlist_id, display_id)
157         videos_paths = re.findall(
158             '(?s)class="shortTitle">.*?href="(/[^"]+)', playlist)
159         entries = [
160             self.url_result('http://vod.tvp.pl%s' % v_path, ie=TvpIE.ie_key())
161             for v_path in videos_paths]
162         return {
163             '_type': 'playlist',
164             'id': playlist_id,
165             'display_id': display_id,
166             'title': title,
167             'entries': entries,
168         }