[youtube] Add a pseudo-extractor for truncated YouTube video IDs (#4610)

[youtube-dl] / youtube_dl / extractor / youtube.py
diff --git a/youtube_dl/extractor/youtube.py b/youtube_dl/extractor/youtube.py

index 224f1b041a6a06c771a210360e1cb20a3c37dc99..8c7842ee84958d59116976bc49d25e4c77b86ad7 100644 (file)
--- a/youtube_dl/extractor/youtube.py
+++ b/youtube_dl/extractor/youtube.py
@@ -612,24 +612,23 @@ class YoutubeIE(YoutubeBaseInfoExtractor, SubtitlesInfoExtractor):
  
      def _get_available_subtitles(self, video_id, webpage):
          try:
-            sub_list = self._download_webpage(
+            subs_doc = self._download_xml(
                  'https://video.google.com/timedtext?hl=en&type=list&v=%s' % video_id,
                  video_id, note=False)
          except ExtractorError as err:
              self._downloader.report_warning('unable to download video subtitles: %s' % compat_str(err))
              return {}
-        lang_list = re.findall(r'name="([^"]*)"[^>]+lang_code="([\w\-]+)"', sub_list)
  
          sub_lang_list = {}
-        for l in lang_list:
-            lang = l[1]
+        for track in subs_doc.findall('track'):
+            lang = track.attrib['lang_code']
              if lang in sub_lang_list:
                  continue
              params = compat_urllib_parse.urlencode({
                  'lang': lang,
                  'v': video_id,
                  'fmt': self._downloader.params.get('subtitlesformat', 'srt'),
-                'name': unescapeHTML(l[0]).encode('utf-8'),
+                'name': track.attrib['name'].encode('utf-8'),
              })
              url = 'https://www.youtube.com/api/timedtext?' + params
              sub_lang_list[lang] = url
@@ -1702,3 +1701,20 @@ class YoutubeTruncatedURLIE(InfoExtractor):
              '"http://www.youtube.com/watch?feature=foo&v=BaW_jenozKc" '
              ' or simply  youtube-dl BaW_jenozKc  .',
              expected=True)
+
+
+class YoutubeTruncatedIDIE(InfoExtractor):
+    IE_NAME = 'youtube:truncated_id'
+    IE_DESC = False  # Do not list
+    _VALID_URL = r'https?://(?:www\.)youtube\.com/watch\?v=(?P<id>[0-9A-Za-z_-]{1,10})$'
+
+    _TESTS = [{
+        'url': 'https://www.youtube.com/watch?v=N_708QY7Ob',
+        'only_matching': True,
+    }]
+
+    def _real_extract(self, url):
+        video_id = self._match_id(url)
+        raise ExtractorError(
+            'Incomplete YouTube ID %s. URL %s looks truncated.' % (video_id, url),
+            expected=True)