[brightcove] Improve the 'experienceJSON' regex (#3081)

[youtube-dl] / youtube_dl / extractor / brightcove.py
diff --git a/youtube_dl/extractor/brightcove.py b/youtube_dl/extractor/brightcove.py

index 031fe385d906dd8f4a53f8440955d325e5b0add1..6b98bd2784069a54bd7f136814d2efab3faf2be4 100644 (file)
--- a/youtube_dl/extractor/brightcove.py
+++ b/youtube_dl/extractor/brightcove.py
@@ -17,6 +17,7 @@ from ..utils import (
  
      ExtractorError,
      unsmuggle_url,
+    unescapeHTML,
  )
  
  
@@ -86,7 +87,7 @@ class BrightcoveIE(InfoExtractor):
          object_str = object_str.replace('<--', '<!--')
          object_str = fix_xml_ampersands(object_str)
  
-        object_doc = xml.etree.ElementTree.fromstring(object_str)
+        object_doc = xml.etree.ElementTree.fromstring(object_str.encode('utf-8'))
  
          fv_el = find_xpath_attr(object_doc, './param', 'name', 'flashVars')
          if fv_el is not None:
@@ -139,7 +140,11 @@ class BrightcoveIE(InfoExtractor):
  
          url_m = re.search(r'<meta\s+property="og:video"\s+content="(http://c.brightcove.com/[^"]+)"', webpage)
          if url_m:
-            return [url_m.group(1)]
+            url = unescapeHTML(url_m.group(1))
+            # Some sites don't add it, we can't download with this url, for example:
+            # http://www.ktvu.com/videos/news/raw-video-caltrain-releases-video-of-man-almost/vCTZdY/
+            if 'playerKey' in url:
+                return [url]
  
          matches = re.findall(
              r'''(?sx)<object
@@ -182,7 +187,7 @@ class BrightcoveIE(InfoExtractor):
          webpage = self._download_webpage(req, video_id)
  
          self.report_extraction(video_id)
-        info = self._search_regex(r'var experienceJSON = ({.*?});', webpage, 'json')
+        info = self._search_regex(r'var experienceJSON = ({.*});', webpage, 'json')
          info = json.loads(info)['data']
          video_info = info['programmedContent']['videoPlayer']['mediaDTO']
          video_info['_youtubedl_adServerURL'] = info.get('adServerURL')