[youtube] PEP 8

[youtube-dl] / youtube_dl / extractor / youtube.py
diff --git a/youtube_dl/extractor/youtube.py b/youtube_dl/extractor/youtube.py

index d66693c0c3079aaebfb3dcf832f47a548f866171..2e71795e780b5dbf80aae3ccfc41a605aa9748a3 100644 (file)
--- a/youtube_dl/extractor/youtube.py
+++ b/youtube_dl/extractor/youtube.py
@@ -673,6 +673,7 @@ class YoutubeIE(YoutubeBaseInfoExtractor):
              },
          },
          # video_info is None (https://github.com/rg3/youtube-dl/issues/4421)
+        # YouTube Red ad is not captured for creator
          {
              'url': '__2ABJjxzNo',
              'info_dict': {
@@ -1269,37 +1270,57 @@ class YoutubeIE(YoutubeBaseInfoExtractor):
                      sub_lang_list[sub_lang] = sub_formats
                  return sub_lang_list
  
+            def make_captions(sub_url, sub_langs):
+                parsed_sub_url = compat_urllib_parse_urlparse(sub_url)
+                caption_qs = compat_parse_qs(parsed_sub_url.query)
+                captions = {}
+                for sub_lang in sub_langs:
+                    sub_formats = []
+                    for ext in self._SUBTITLE_FORMATS:
+                        caption_qs.update({
+                            'tlang': [sub_lang],
+                            'fmt': [ext],
+                        })
+                        sub_url = compat_urlparse.urlunparse(parsed_sub_url._replace(
+                            query=compat_urllib_parse_urlencode(caption_qs, True)))
+                        sub_formats.append({
+                            'url': sub_url,
+                            'ext': ext,
+                        })
+                    captions[sub_lang] = sub_formats
+                return captions
+
+            # New captions format as of 22.06.2017
+            player_response = args.get('player_response')
+            if player_response and isinstance(player_response, compat_str):
+                player_response = self._parse_json(
+                    player_response, video_id, fatal=False)
+                if player_response:
+                    renderer = player_response['captions']['playerCaptionsTracklistRenderer']
+                    base_url = renderer['captionTracks'][0]['baseUrl']
+                    sub_lang_list = []
+                    for lang in renderer['translationLanguages']:
+                        lang_code = lang.get('languageCode')
+                        if lang_code:
+                            sub_lang_list.append(lang_code)
+                    return make_captions(base_url, sub_lang_list)
+
              # Some videos don't provide ttsurl but rather caption_tracks and
              # caption_translation_languages (e.g. 20LmZk1hakA)
+            # Does not used anymore as of 22.06.2017
              caption_tracks = args['caption_tracks']
              caption_translation_languages = args['caption_translation_languages']
              caption_url = compat_parse_qs(caption_tracks.split(',')[0])['u'][0]
-            parsed_caption_url = compat_urllib_parse_urlparse(caption_url)
-            caption_qs = compat_parse_qs(parsed_caption_url.query)
-
-            sub_lang_list = {}
+            sub_lang_list = []
              for lang in caption_translation_languages.split(','):
                  lang_qs = compat_parse_qs(compat_urllib_parse_unquote_plus(lang))
                  sub_lang = lang_qs.get('lc', [None])[0]
-                if not sub_lang:
-                    continue
-                sub_formats = []
-                for ext in self._SUBTITLE_FORMATS:
-                    caption_qs.update({
-                        'tlang': [sub_lang],
-                        'fmt': [ext],
-                    })
-                    sub_url = compat_urlparse.urlunparse(parsed_caption_url._replace(
-                        query=compat_urllib_parse_urlencode(caption_qs, True)))
-                    sub_formats.append({
-                        'url': sub_url,
-                        'ext': ext,
-                    })
-                sub_lang_list[sub_lang] = sub_formats
-            return sub_lang_list
+                if sub_lang:
+                    sub_lang_list.append(sub_lang)
+            return make_captions(caption_url, sub_lang_list)
          # An extractor error can be raise by the download process if there are
          # no automatic captions but there are subtitles
-        except (KeyError, ExtractorError):
+        except (KeyError, IndexError, ExtractorError):
              self._downloader.report_warning(err_msg)
              return {}
  
@@ -1353,10 +1374,16 @@ class YoutubeIE(YoutubeBaseInfoExtractor):
              start_time = parse_duration(time_point)
              if start_time is None:
                  continue
+            if start_time > duration:
+                break
              end_time = (duration if next_num == len(chapter_lines)
                          else parse_duration(chapter_lines[next_num][1]))
              if end_time is None:
                  continue
+            if end_time > duration:
+                end_time = duration
+            if start_time > end_time:
+                break
              chapter_title = re.sub(
                  r'<a[^>]+>[^<]+</a>', '', chapter_line).strip(' \t-')
              chapter_title = re.sub(r'\s+', ' ', chapter_title)
@@ -1481,8 +1508,7 @@ class YoutubeIE(YoutubeBaseInfoExtractor):
                      if not video_info_webpage:
                          continue
                      get_video_info = compat_parse_qs(video_info_webpage)
-                    if get_video_info.get('use_cipher_signature') != ['True']:
-                        add_dash_mpd(get_video_info)
+                    add_dash_mpd(get_video_info)
                      if not video_info:
                          video_info = get_video_info
                      if 'token' in get_video_info:
@@ -1624,7 +1650,21 @@ class YoutubeIE(YoutubeBaseInfoExtractor):
              video_webpage, 'license', default=None)
  
          m_music = re.search(
-            r'<h4[^>]+class="title"[^>]*>\s*Music\s*</h4>\s*<ul[^>]*>\s*<li>(?P<title>.+?) by (?P<creator>.+?)(?:\(.+?\))?</li',
+            r'''(?x)
+                <h4[^>]+class="title"[^>]*>\s*Music\s*</h4>\s*
+                <ul[^>]*>\s*
+                <li>(?P<title>.+?)
+                by (?P<creator>.+?)
+                (?:
+                    \(.+?\)|
+                    <a[^>]*
+                        (?:
+                            \bhref=["\']/red[^>]*>|             # drop possible
+                            >\s*Listen ad-free with YouTube Red # YouTube Red ad
+                        )
+                    .*?
+                )?</li
+            ''',
              video_webpage)
          if m_music:
              video_alt_title = remove_quotes(unescapeHTML(m_music.group('title')))
@@ -1716,12 +1756,8 @@ class YoutubeIE(YoutubeBaseInfoExtractor):
                  format_id = url_data['itag'][0]
                  url = url_data['url'][0]
  
-                if 'sig' in url_data:
-                    url += '&signature=' + url_data['sig'][0]
-                elif 's' in url_data:
-                    encrypted_sig = url_data['s'][0]
+                if 's' in url_data or self._downloader.params.get('youtube_include_dash_manifest', True):
                      ASSETS_RE = r'"assets":.+?"js":\s*("[^"]+")'
-
                      jsplayer_url_json = self._search_regex(
                          ASSETS_RE,
                          embed_webpage if age_gate else video_webpage,
@@ -1742,6 +1778,11 @@ class YoutubeIE(YoutubeBaseInfoExtractor):
                              video_webpage, 'age gate player URL')
                          player_url = json.loads(player_url_json)
  
+                if 'sig' in url_data:
+                    url += '&signature=' + url_data['sig'][0]
+                elif 's' in url_data:
+                    encrypted_sig = url_data['s'][0]
+
                      if self._downloader.params.get('verbose'):
                          if player_url is None:
                              player_version = 'unknown'