admin管理员组

文章数量:1530842

1 数据获取

腾讯视频的网站中隐含的是一个非结构化的数据。R语言的“XML”包中htmlParse和getNodeSet非常强大,通过htmlParse可以抓取页面数据并形成树状结构,getNodeSet可以对抓取的数据根据XPath语法来选取特定的节点集合。“revst”包的html_nodes与html_attr可以分别获得节点和属性。
下面是爬取腾讯视频网站中电影数据的一部分关键代码:

1.1加载一些包

library(rvest)
library(XML)
library(dplyr)

1.2 读取页面

腾讯视频中热门电影的显示情况为每页显示30条数据,据此设置要爬取的每个网页的URL依次访问,read_html函数读取网页信息。

num = seq(from=0,by</

本文标签: 腾讯数据视频网站