Python爬取腾讯视频评论的思路详解

2025-02-11 03:27:54

一、前提条件

安装了Fiddler了（用于抓包分析）
谷歌或火狐浏览器
如果是谷歌浏览器，还需要给谷歌浏览器安装一个SwitchyOmega插件，用于代理服务器
有Python的编译环境，一般选择Python3.0及以上

声明：本次爬取腾讯视频里 《最美公里》纪录片的评论。本次爬取使用的浏览器是谷歌浏览器

二、分析思路

1、分析评论页面

根据上图，我们可以知道：评论使用了Ajax异步刷新技术。这样就不能使用以前分析当前页面找出规律的手段了。因为展示的页面只有部分评论，还有大量的评论没有被刷新出来。

这时，我们应该想到使用抓包来分析评论页面刷新的规律。以后大部分爬虫，都会先使用抓包技术，分析出规律！

2、使用Fiddler进行抓包分析——得出评论网址规律

fiddler如何抓包，这个知识点，需要读者自行去学习，不在本博客讨论范围。

把上面两张图里面的内容对比一下，可以知道这个JS就是评论存放页面。（这需要大家一个一个找，一般Ajax都是在JS里面，所以这也找JS进行对比即可）

我们复制这个JS的url：右击 > copy > Just Url

大家可以重复操作几次，多找几个JS的url，从url得出规律。下图是我刷新了4次得到的JS的url：

根据上图，我们发现url不同的地方有两处：一是cursor=？；二是_=？。

我们很快就能发现 _=？的规律，它是从1576567187273加1。而cursor=？的规律看不出来。这个时候找到它的规律呢？

（1）百度一下，看前人有没有爬取过类型的网站，根据他们的规律和方法，去找出规律；

（2）羊毛出在羊身上。我们需要有的大胆想法——会不会这个cursor=?可以根据上一个JS页面得到呢？这只是很多大胆想法中的一个，我们就一个想法一个想法的试试。

我们就采用第二种方法，去js里面找。复制其中一个url为：

url = https://video.coral.qq.com/varticle/3242201702/comment/v2?callback=_varticle3242201702commentv2&orinum=10&oriorder=o&pageflag=1&cursor=6460163812968870071&scorecursor=0&orirepnum=2&reporder=o&reppageflag=1&source=132&_=1576567187273

去浏览器里面打开，在里面搜索一下此url的下一个url的cursor=？的值。我们发现一个惊喜！

如下：

一般情况下，我们还要多试几次，确定我们的想法是正确的。

至此，我们发现了评论的url之间的规律：

_=？从1576567187273加1
cursor=？的值存在上面一个JS中。

三、代码编写

import re
import random
import urllib.request

#构建用户代理
uapools=["Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/75.0.3770.100 Safari/537.36",
  "Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/55.0.2883.87 Safari/537.36",
  "Mozilla/5.0 (Windows NT 10.0; Win64; x64; rv:71.0) Gecko/20100101 Firefox/71.0",
 ]
#从用户代理池随机选取一个用户代理
def ua(uapools):
 thisua=random.choice(uapools)
 #print(thisua)
 headers=("User-Agent",thisua)
 opener=urllib.request.build_opener()
 opener.addheaders=[headers]
 #设置为全局变量
 urllib.request.install_opener(opener)

#获取源码
def get_content(page,lastId):
 url="https://video.coral.qq.com/varticle/3242201702/comment/v2?callback=_varticle3242201702commentv2&orinum=10&oriorder=o&pageflag=1&cursor="+lastId+"&scorecursor=0&orirepnum=2&reporder=o&reppageflag=1&source=132&_="+str(page)
 html=urllib.request.urlopen(url).read().decode("utf-8","ignore")
 return html

#从源码中获取评论的数据
def get_comment(html):
 pat='"content":"(.*?)"'
 rst = re.compile(pat,re.S).findall(html)
 return rst

#从源码中获取下一轮刷新页的ID
def get_lastId(html):
 pat='"last":"(.*?)"'
 lastId = re.compile(pat,re.S).findall(html)[0]
 return lastId

def main():
 ua(uapools)
 #初始页面
 page=1576567187274
 #初始待刷新页面ID
 lastId="6460393679757345760"
 for i in range(1,6):
 html = get_content(page,lastId)
 #获取评论数据
 commentlist=get_comment(html)
 print("------第"+str(i)+"轮页面评论------")
 for j in range(1,len(commentlist)):
  print("第"+str(j)+"条评论：" +str(commentlist[j]))
 #获取下一轮刷新页ID
 lastId=get_lastId(html)
 page += 1

main()

四、结果展示

总结

以上所述是小编给大家介绍的Python爬取腾讯视频评论，希望对大家有所帮助，如果大家有任何疑问请给我留言，小编会及时回复大家的。在此也非常感谢大家对我们网站的支持！
如果你觉得本文对你有帮助，欢迎转载，烦请注明出处，谢谢！

使用python实现抓取腾讯视频所有电影的爬虫

用python实现的抓取腾讯视频所有电影的爬虫 # -*- coding: utf-8 -*- import re import urllib2 from bs4import BeautifulSoup import string, time import pymongo NUM =0 #全局变量,电影数量 m_type = u'' #全局变量,电影类型 m_site = u'qq' #全局变量,电影网站 #根据指定的URL获取网页内容 def gethtml(url): req = urlli
基于python实现的抓取腾讯视频所有电影的爬虫

我搜集了国内10几个电影网站的数据,里面近几十W条记录,用文本没法存,mongodb学习成本非常低,安装.下载.运行起来不会花你5分钟时间. # -*- coding: utf-8 -*- # by awakenjoys. my site: www.dianying.at import re import urllib2 from bs4 import BeautifulSoup import string, time import pymongo NUM = 0 #全局变量,电影数量 m_ty
Python爬取腾讯视频评论的思路详解

一.前提条件安装了Fiddler了(用于抓包分析) 谷歌或火狐浏览器如果是谷歌浏览器,还需要给谷歌浏览器安装一个SwitchyOmega插件,用于代理服务器有Python的编译环境,一般选择Python3.0及以上声明:本次爬取腾讯视频里 <最美公里>纪录片的评论.本次爬取使用的浏览器是谷歌浏览器二.分析思路 1.分析评论页面根据上图,我们可以知道:评论使用了Ajax异步刷新技术.这样就不能使用以前分析当前页面找出规律的手段了.因为展示的页面只有部分评论,还有大量的评论没有被刷新出
python 爬取腾讯视频评论的实现步骤

一.网址分析查阅了网上的大部分资料,大概都是通过抓包获取.但是抓包有点麻烦,尝试了F12,也可以获取到评论.以电视剧<在一起>为例子.评论最底端有个查看更多评论猜测过去应该是 Ajax 的异步加载. 网上的大部分都是构建评论的网址,通过 requests 获取,正则表达式进行数据处理.本文也利用该方法进行数据处理,其实利用 scrapy 会更简单. 根据前辈给出的经验,顺利找到了评论所在的链接. 在新标签中打开,该网址的链接. 评论都在"content":"xx
python 爬取华为应用市场评论

代码分享整个项目我放在了github上,在python3.7下可以正常使用,如果有什么问题欢迎大家指正. github项目地址:https://github.com/LSY-C/scrapy_hauweiappstore_comment 分别爬取的一些应用信息以及应用的评论信息,数据结构如下: 一.安装并创建Scrapy项目 Scrapy官方文档:https://docs.scrapy.org/en/latest/intro/install.html Scrapy是一个比较好用的python爬
使用python爬取抖音视频列表信息

如果看到特别感兴趣的抖音vlogger的视频,想全部dump下来,如何操作呢?下面介绍介绍如何使用python导出特定用户所有视频信息抓包分析 Chrome Deveploer Tools Chrome 浏览器开发者工具在抖音APP端,复制vlogger主页地址, 比如: http://v.douyin.com/kGcU4y/ , 在PC端用chrome浏览器打卡,并模拟手机,这里选择iPhone, 然后把复制的主页地址,放到浏览器进行访问,页面跳转到 https://www.iesdouy
python爬取网易云音乐评论

本文实例为大家分享了python爬取网易云音乐评论的具体代码,供大家参考,具体内容如下 import requests import bs4 import json def get_hot_comments(res): comments_json = json.loads(res.text) hot_comments = comments_json['hotComments'] with open("hotcmments.txt", 'w', encoding = 'utf-8') a
python爬取抖音视频的实例分析

现在抖音的火爆程度,大家都是有目共睹的吧,之前小编在网络上发现好玩的事情,就是去爬取一些网站,因此,也考虑能否进行抖音上的破案去,在实际操作以后,真的实现出来了,利用自动化工具,就可以轻松实现了,后有小伙伴提出把appium去掉瘦身之后也是可以实现的,那么看下详细操作内容吧. 1.mitmproxy/mitmdump抓包 import requests path = 'D:/video/' num = 1788 def response(flow): global num target_urls
Python爬取腾讯疫情实时数据并存储到mysql数据库的示例代码

思路: 在腾讯疫情数据网站F12解析网站结构,使用Python爬取当日疫情数据和历史疫情数据,分别存储到details和history两个mysql表. ①此方法用于爬取每日详细疫情数据 import requests import json import time def get_details(): url = 'https://view.inews.qq.com/g2/getOnsInfo?name=disease_h5&callback=jQuery3410284820553141302
python 爬取京东指定商品评论并进行情感分析

项目地址 https://github.com/DA1YAYUAN/JD-comments-sentiment-analysis 爬取京东商城中指定商品下的用户评论,对数据预处理后基于SnowNLP的sentiment模块对文本进行情感分析. 运行环境 Mac OS X Python3.7 requirements.txt Pycharm 运行方法数据爬取(jd.comment.py) 启动jd_comment.py,建议修改jd_comment.py中变量user-agent为自己浏览器用户
Python爬取京东商品信息评论存并进MySQL

目录构建mysql数据表第一版: 第二版 : 第三版: 构建mysql数据表问题:使用SQL alchemy时,非主键不能设置为自增长,但是我想让这个非主键仅仅是为了作为索引,autoincrement=True无效,该怎么实现让它自增长呢? from sqlalchemy import String,Integer,Text,Column from sqlalchemy import create_engine from sqlalchemy.orm import sessionmake
Python爬取网易云歌曲评论实现词云图

目录前言环境使用代码实现先是安装.导入所需模块 1. 创建一个浏览器对象 2. 执行自动化下拉页面, 直接下拉到页面的底部 3.解析数据保存数据翻页保存为txt文件运行代码得到结果再做个词云导入相关模块读取文件数据词云图分词<中文(词语)> 基于结果合并创建词云图最后效果前言 emmmm 没什么说的,想说的都在代码里环境使用 Python 3.8 解释器 3.10 Pycharm 2021.2 专业版 selenium 3.141.0 本次要用到selen

Python爬取腾讯视频评论的思路详解

相关推荐

随机推荐