[pornhub] Extract metadata from JSON-LD (closes #26614)

[youtube-dl] / youtube_dl / extractor / pornhub.py
diff --git a/youtube_dl/extractor/pornhub.py b/youtube_dl/extractor/pornhub.py

index ba0ad7da29d188f5e920376805bf7532a1613bee..529f3f7119fd4e93a8c82168d910ab4fc3d1720e 100644 (file)
--- a/youtube_dl/extractor/pornhub.py
+++ b/youtube_dl/extractor/pornhub.py
@@ -17,6 +17,8 @@ from ..utils import (
      determine_ext,
      ExtractorError,
      int_or_none,
+    merge_dicts,
+    NO_DEFAULT,
      orderedSet,
      remove_quotes,
      str_to_int,
@@ -51,20 +53,21 @@ class PornHubIE(PornHubBaseIE):
      _VALID_URL = r'''(?x)
                      https?://
                          (?:
-                            (?:[^/]+\.)?(?P<host>pornhub\.(?:com|net))/(?:(?:view_video\.php|video/show)\?viewkey=|embed/)|
+                            (?:[^/]+\.)?(?P<host>pornhub(?:premium)?\.(?:com|net))/(?:(?:view_video\.php|video/show)\?viewkey=|embed/)|
                              (?:www\.)?thumbzilla\.com/video/
                          )
                          (?P<id>[\da-z]+)
                      '''
      _TESTS = [{
          'url': 'http://www.pornhub.com/view_video.php?viewkey=648719015',
-        'md5': '1e19b41231a02eba417839222ac9d58e',
+        'md5': 'a6391306d050e4547f62b3f485dd9ba9',
          'info_dict': {
              'id': '648719015',
              'ext': 'mp4',
              'title': 'Seductive Indian beauty strips down and fingers her pink pussy',
              'uploader': 'Babes',
              'upload_date': '20130628',
+            'timestamp': 1372447216,
              'duration': 361,
              'view_count': int,
              'like_count': int,
@@ -81,8 +84,8 @@ class PornHubIE(PornHubBaseIE):
              'id': '1331683002',
              'ext': 'mp4',
              'title': '重庆婷婷女王足交',
-            'uploader': 'Unknown',
              'upload_date': '20150213',
+            'timestamp': 1423804862,
              'duration': 1753,
              'view_count': int,
              'like_count': int,
@@ -120,6 +123,7 @@ class PornHubIE(PornHubBaseIE):
          'params': {
              'skip_download': True,
          },
+        'skip': 'This video has been disabled',
      }, {
          'url': 'http://www.pornhub.com/view_video.php?viewkey=ph557bbb6676d2d',
          'only_matching': True,
@@ -148,6 +152,9 @@ class PornHubIE(PornHubBaseIE):
      }, {
          'url': 'https://www.pornhub.net/view_video.php?viewkey=203640933',
          'only_matching': True,
+    }, {
+        'url': 'https://www.pornhubpremium.com/view_video.php?viewkey=ph5e4acdae54a82',
+        'only_matching': True,
      }]
  
      @staticmethod
@@ -165,6 +172,13 @@ class PornHubIE(PornHubBaseIE):
          host = mobj.group('host') or 'pornhub.com'
          video_id = mobj.group('id')
  
+        if 'premium' in host:
+            if not self._downloader.params.get('cookiefile'):
+                raise ExtractorError(
+                    'PornHub Premium requires authentication.'
+                    ' You may want to use --cookies.',
+                    expected=True)
+
          self._set_cookie(host, 'age_verified', '1')
  
          def dl_webpage(platform):
@@ -188,10 +202,10 @@ class PornHubIE(PornHubBaseIE):
          # http://www.pornhub.com/view_video.php?viewkey=1331683002), not relying
          # on that anymore.
          title = self._html_search_meta(
-            'twitter:title', webpage, default=None) or self._search_regex(
-            (r'<h1[^>]+class=["\']title["\'][^>]*>(?P<title>[^<]+)',
-             r'<div[^>]+data-video-title=(["\'])(?P<title>.+?)\1',
-             r'shareTitle\s*=\s*(["\'])(?P<title>.+?)\1'),
+            'twitter:title', webpage, default=None) or self._html_search_regex(
+            (r'(?s)<h1[^>]+class=["\']title["\'][^>]*>(?P<title>.+?)</h1>',
+             r'<div[^>]+data-video-title=(["\'])(?P<title>(?:(?!\1).)+)\1',
+             r'shareTitle["\']\s*[=:]\s*(["\'])(?P<title>(?:(?!\1).)+)\1'),
              webpage, 'title', group='title')
  
          video_urls = []
@@ -227,12 +241,13 @@ class PornHubIE(PornHubBaseIE):
          else:
              thumbnail, duration = [None] * 2
  
-        if not video_urls:
-            tv_webpage = dl_webpage('tv')
-
+        def extract_js_vars(webpage, pattern, default=NO_DEFAULT):
              assignments = self._search_regex(
-                r'(var.+?mediastring.+?)</script>', tv_webpage,
-                'encoded url').split(';')
+                pattern, webpage, 'encoded url', default=default)
+            if not assignments:
+                return {}
+
+            assignments = assignments.split(';')
  
              js_vars = {}
  
@@ -254,11 +269,35 @@ class PornHubIE(PornHubBaseIE):
                  assn = re.sub(r'var\s+', '', assn)
                  vname, value = assn.split('=', 1)
                  js_vars[vname] = parse_js_value(value)
+            return js_vars
  
-            video_url = js_vars['mediastring']
-            if video_url not in video_urls_set:
-                video_urls.append((video_url, None))
-                video_urls_set.add(video_url)
+        def add_video_url(video_url):
+            v_url = url_or_none(video_url)
+            if not v_url:
+                return
+            if v_url in video_urls_set:
+                return
+            video_urls.append((v_url, None))
+            video_urls_set.add(v_url)
+
+        if not video_urls:
+            FORMAT_PREFIXES = ('media', 'quality')
+            js_vars = extract_js_vars(
+                webpage, r'(var\s+(?:%s)_.+)' % '|'.join(FORMAT_PREFIXES),
+                default=None)
+            if js_vars:
+                for key, format_url in js_vars.items():
+                    if any(key.startswith(p) for p in FORMAT_PREFIXES):
+                        add_video_url(format_url)
+            if not video_urls and re.search(
+                    r'<[^>]+\bid=["\']lockedPlayer', webpage):
+                raise ExtractorError(
+                    'Video %s is locked' % video_id, expected=True)
+
+        if not video_urls:
+            js_vars = extract_js_vars(
+                dl_webpage('tv'), r'(var.+?mediastring.+?)</script>')
+            add_video_url(js_vars['mediastring'])
  
          for mobj in re.finditer(
                  r'<a[^>]+\bclass=["\']downloadBtn\b[^>]+\bhref=(["\'])(?P<url>(?:(?!\1).)+)\1',
@@ -276,10 +315,16 @@ class PornHubIE(PornHubBaseIE):
                      r'/(\d{6}/\d{2})/', video_url, 'upload data', default=None)
                  if upload_date:
                      upload_date = upload_date.replace('/', '')
-            if determine_ext(video_url) == 'mpd':
+            ext = determine_ext(video_url)
+            if ext == 'mpd':
                  formats.extend(self._extract_mpd_formats(
                      video_url, video_id, mpd_id='dash', fatal=False))
                  continue
+            elif ext == 'm3u8':
+                formats.extend(self._extract_m3u8_formats(
+                    video_url, video_id, 'mp4', entry_protocol='m3u8_native',
+                    m3u8_id='hls', fatal=False))
+                continue
              tbr = None
              mobj = re.search(r'(?P<height>\d+)[pP]?_(?P<tbr>\d+)[kK]', video_url)
              if mobj:
@@ -296,10 +341,10 @@ class PornHubIE(PornHubBaseIE):
  
          video_uploader = self._html_search_regex(
              r'(?s)From:&nbsp;.+?<(?:a\b[^>]+\bhref=["\']/(?:(?:user|channel)s|model|pornstar)/|span\b[^>]+\bclass=["\']username)[^>]+>(.+?)<',
-            webpage, 'uploader', fatal=False)
+            webpage, 'uploader', default=None)
  
          view_count = self._extract_count(
-            r'<span class="count">([\d,\.]+)</span> views', webpage, 'view')
+            r'<span class="count">([\d,\.]+)</span> [Vv]iews', webpage, 'view')
          like_count = self._extract_count(
              r'<span class="votesUp">([\d,\.]+)</span>', webpage, 'like')
          dislike_count = self._extract_count(
@@ -314,7 +359,11 @@ class PornHubIE(PornHubBaseIE):
              if div:
                  return re.findall(r'<a[^>]+\bhref=[^>]+>([^<]+)', div)
  
-        return {
+        info = self._search_json_ld(webpage, video_id, default={})
+        # description provided in JSON-LD is irrelevant
+        info['description'] = None
+
+        return merge_dicts({
              'id': video_id,
              'uploader': video_uploader,
              'upload_date': upload_date,
@@ -330,7 +379,7 @@ class PornHubIE(PornHubBaseIE):
              'tags': extract_list('tags'),
              'categories': extract_list('categories'),
              'subtitles': subtitles,
-        }
+        }, info)
  
  
  class PornHubPlaylistBaseIE(PornHubBaseIE):
@@ -373,7 +422,7 @@ class PornHubPlaylistBaseIE(PornHubBaseIE):
  
  
  class PornHubUserIE(PornHubPlaylistBaseIE):
-    _VALID_URL = r'(?P<url>https?://(?:[^/]+\.)?pornhub\.(?:com|net)/(?:(?:user|channel)s|model|pornstar)/(?P<id>[^/?#&]+))(?:[?#&]|/(?!videos)|$)'
+    _VALID_URL = r'(?P<url>https?://(?:[^/]+\.)?(?P<host>pornhub(?:premium)?\.(?:com|net))/(?:(?:user|channel)s|model|pornstar)/(?P<id>[^/?#&]+))(?:[?#&]|/(?!videos)|$)'
      _TESTS = [{
          'url': 'https://www.pornhub.com/model/zoe_ph',
          'playlist_mincount': 118,
@@ -441,7 +490,7 @@ class PornHubPagedPlaylistBaseIE(PornHubPlaylistBaseIE):
  
  
  class PornHubPagedVideoListIE(PornHubPagedPlaylistBaseIE):
-    _VALID_URL = r'https?://(?:[^/]+\.)?(?P<host>pornhub\.(?:com|net))/(?P<id>(?:[^/]+/)*[^/?#&]+)'
+    _VALID_URL = r'https?://(?:[^/]+\.)?(?P<host>pornhub(?:premium)?\.(?:com|net))/(?P<id>(?:[^/]+/)*[^/?#&]+)'
      _TESTS = [{
          'url': 'https://www.pornhub.com/model/zoe_ph/videos',
          'only_matching': True,
@@ -556,7 +605,7 @@ class PornHubPagedVideoListIE(PornHubPagedPlaylistBaseIE):
  
  
  class PornHubUserVideosUploadIE(PornHubPagedPlaylistBaseIE):
-    _VALID_URL = r'(?P<url>https?://(?:[^/]+\.)?(?P<host>pornhub\.(?:com|net))/(?:(?:user|channel)s|model|pornstar)/(?P<id>[^/]+)/videos/upload)'
+    _VALID_URL = r'(?P<url>https?://(?:[^/]+\.)?(?P<host>pornhub(?:premium)?\.(?:com|net))/(?:(?:user|channel)s|model|pornstar)/(?P<id>[^/]+)/videos/upload)'
      _TESTS = [{
          'url': 'https://www.pornhub.com/pornstar/jenny-blighe/videos/upload',
          'info_dict': {